به تازگی، گروهی از سه پژوهشگر برای ارزیابی قابلیت‌های هوش مصنوعی در محیط واقعی، یک چالش خلاقانه طراحی کردند: هدایت یک خودروی خودران در مسیری معین تحت نظارت انسان. این آزمایش جذاب به‌وسیله یک تویوتا کرولا از سال ۲۰۲۲ انجام شد و مدل‌های پیشرفته هوش مصنوعی نظیر Grok و GPT به عنوان راننده در نظر گرفته شدند. هدف اصلی این بود که مشخص شود آیا این مدل‌های زبانی عظیم که برای تولید متن طراحی شده‌اند، توانایی انجام وظایف پیچیده رانندگی را نیز دارند یا خیر. نتایج به‌دست‌آمده نشان‌دهنده محدودیت‌های فعلی هوش مصنوعی در تعامل با دنیای فیزیکی بود.

این سه پژوهشگر، آدیتیا رامابادران، سایمون مانس و توبیاس گسلر، پلتفرم DrivingBench را به‌منظور ارزیابی قابلیت‌های مدل‌های هوش مصنوعی در هدایت یک خودروی واقعی ایجاد کردند. در این آزمایش، مدل‌های هوش مصنوعی مانند Claude، GPT، Grok و GPT-6 Astra رانندگان تویوتا کرولا ۲۰۲۲ بودند. مسیر آزمون ۱۳۴.۷ متر طول داشت و با مخروط‌هایی مشخص شده بود. در مجموع، ۱۱ دور آزمایشی با چهار مدل مختلف انجام شد که از میان آنها، هشت مدل نتوانستند بیشتر از ۱۱ درصد مسیر را طی کنند و یا پیش از رسیدن به پیچ اول متوقف شدند یا دچار تصادف شدند. تنها یک مدل، یعنی GPT-6 Astra از OpenAI، موفق شد در تلاش دوم خود مسیر کامل را طی کند.

چالش‌های هوش مصنوعی در آزمون رانندگی: از Grok تا Claude

Grok 4.6 در سه دور آزمایش هرگز نتوانست از ۱۱ درصد مسیر فراتر برود. در یکی از تلاش‌هایش، این مدل شکاف بین مخروط‌ها را به‌عنوان یک مسیر ورودی در نظر گرفت و از مسیر اصلی منحرف شد. دیگر تلاش‌های Grok نیز موفق نبود و تنها ۸ تا ۱۰ درصد مسیر را طی کرد و در حدود ۲۲ متر متوقف شد. مدلی دیگر از GPT به نام GPT-5.6 Sol با یک چالش منطقی مواجه شد و علی‌رغم دستورالعمل‌های واضح، قانونی خودساخته درباره رنگ مخروط‌ها وضع کرد و لذا در هر سه تلاش، تنها ۶ درصد از مسیر را طی کرد. مدل Fable 5.1 از Claude کارایی بهتری داشت و تا ۴۵ درصد مسیر را طی کرد، اما نتوانست آن را به انتها برساند. مشکل اصلی در اکثر این مدل‌ها، ناتوانی در محاسبه دقیق زاویه فرمان لازم برای چرخش‌ها بود که منجر به برخورد خودروها با مخروط‌ها یا چرخش بیش از حد فرمان و خروج از مسیر شد.

چرا مدل‌های هوش مصنوعی در رانندگی شکست خوردند؟

خودرو با حداکثر سرعت ۳.۵ متر بر ثانیه حرکت می‌کرد و قابلیت هدایت آن محدود بود. هر مدل هوش مصنوعی تنها با مشاهده فریم‌های دوربین، مسیر را تشخیص داده و دستورات حرکتی شامل جهت، درصد فرمان، سرعت و زمان را صادر می‌کرد. این دستورات باید به‌طور مداوم ارسال می‌شدند؛ در غیر این صورت، خودرو به‌صورت خودکار ترمز می‌کرد. این چرخه مستمر خواندن و واکنش به ورودی‌ها جایی بود که هوش مصنوعی در آزمون رانندگی با مشکلاتی مواجه شد. مدل‌ها که به‌طور بنیادی برای تولید متن طراحی شده بودند، زمان زیادی را به پردازش و تصمیم‌گیری اختصاص می‌دادند. برای مثال، مدل Fable از Claude در یک دور ۱۹۰ ثانیه‌ای، تنها ۳۱ ثانیه در حال حرکت بود و بقیه زمان را صرف تفکر و تأمل کرد. این تأخیرها موجب می‌شد خودرو بدون ورودی مناسب به حرکت درآید و در مواجهه با چالش‌های آنی، مانند تشخیص پیچ‌ها و تعیین موقعیت صحیح مسیر، ناکارآمد باقی بماند.

GPT-6 Astra؛ تنها موفق در آزمون رانندگی، اما هزینه‌بر

GPT-6 Astra در تلاش اول خود تا ۴۹ درصد مسیر پیش رفت. در تلاش دوم، این مدل توانست پس از حرکتی آهسته به مدت ۵ دقیقه و ۲۲ ثانیه، مسیر را به پایان برساند. جالب توجه است که آسترا در ۲۰ فرمان از ۲۴ فرمان خود، حداکثر زاویه فرمان را به کار گرفت که نشان می‌دهد این مدل پس از شکست اولیه، این استراتژی را آموخته بود. این موفقیت برای GPT-6 Astra ارزان تمام نشد؛ هزینه مصرف توکن‌ها برای این دور موفق تصویری برابر با ۷.۷۴ دلار بود که تقریباً چهار برابر هزینه تلاش ناموفق ابتدایی آن به شمار می‌رفت. در مقایسه، Grok در تلاش سوم خود (که تنها ۲۲ متر را طی کرد و ناکام ماند) بیش از ۵۱۶,۰۰۰ توکن مصرف کرده بود. این آزمایش‌ها به وضوح نشان داد که اگرچه یک مدل هوش مصنوعی می‌تواند در رانندگی واقعی موفق شود، اما این روش در حال حاضر بسیار کند و پرهزینه است و هنوز فاصله زیادی با سیستم‌های خودران تخصصی مانند Waymo دارد.

اتومبیل خودران