به تازگی، گروهی از سه پژوهشگر برای ارزیابی قابلیتهای هوش مصنوعی در محیط واقعی، یک چالش خلاقانه طراحی کردند: هدایت یک خودروی خودران در مسیری معین تحت نظارت انسان. این آزمایش جذاب بهوسیله یک تویوتا کرولا از سال ۲۰۲۲ انجام شد و مدلهای پیشرفته هوش مصنوعی نظیر Grok و GPT به عنوان راننده در نظر گرفته شدند. هدف اصلی این بود که مشخص شود آیا این مدلهای زبانی عظیم که برای تولید متن طراحی شدهاند، توانایی انجام وظایف پیچیده رانندگی را نیز دارند یا خیر. نتایج بهدستآمده نشاندهنده محدودیتهای فعلی هوش مصنوعی در تعامل با دنیای فیزیکی بود.
این سه پژوهشگر، آدیتیا رامابادران، سایمون مانس و توبیاس گسلر، پلتفرم DrivingBench را بهمنظور ارزیابی قابلیتهای مدلهای هوش مصنوعی در هدایت یک خودروی واقعی ایجاد کردند. در این آزمایش، مدلهای هوش مصنوعی مانند Claude، GPT، Grok و GPT-6 Astra رانندگان تویوتا کرولا ۲۰۲۲ بودند. مسیر آزمون ۱۳۴.۷ متر طول داشت و با مخروطهایی مشخص شده بود. در مجموع، ۱۱ دور آزمایشی با چهار مدل مختلف انجام شد که از میان آنها، هشت مدل نتوانستند بیشتر از ۱۱ درصد مسیر را طی کنند و یا پیش از رسیدن به پیچ اول متوقف شدند یا دچار تصادف شدند. تنها یک مدل، یعنی GPT-6 Astra از OpenAI، موفق شد در تلاش دوم خود مسیر کامل را طی کند.
چالشهای هوش مصنوعی در آزمون رانندگی: از Grok تا Claude
Grok 4.6 در سه دور آزمایش هرگز نتوانست از ۱۱ درصد مسیر فراتر برود. در یکی از تلاشهایش، این مدل شکاف بین مخروطها را بهعنوان یک مسیر ورودی در نظر گرفت و از مسیر اصلی منحرف شد. دیگر تلاشهای Grok نیز موفق نبود و تنها ۸ تا ۱۰ درصد مسیر را طی کرد و در حدود ۲۲ متر متوقف شد. مدلی دیگر از GPT به نام GPT-5.6 Sol با یک چالش منطقی مواجه شد و علیرغم دستورالعملهای واضح، قانونی خودساخته درباره رنگ مخروطها وضع کرد و لذا در هر سه تلاش، تنها ۶ درصد از مسیر را طی کرد. مدل Fable 5.1 از Claude کارایی بهتری داشت و تا ۴۵ درصد مسیر را طی کرد، اما نتوانست آن را به انتها برساند. مشکل اصلی در اکثر این مدلها، ناتوانی در محاسبه دقیق زاویه فرمان لازم برای چرخشها بود که منجر به برخورد خودروها با مخروطها یا چرخش بیش از حد فرمان و خروج از مسیر شد.
چرا مدلهای هوش مصنوعی در رانندگی شکست خوردند؟
خودرو با حداکثر سرعت ۳.۵ متر بر ثانیه حرکت میکرد و قابلیت هدایت آن محدود بود. هر مدل هوش مصنوعی تنها با مشاهده فریمهای دوربین، مسیر را تشخیص داده و دستورات حرکتی شامل جهت، درصد فرمان، سرعت و زمان را صادر میکرد. این دستورات باید بهطور مداوم ارسال میشدند؛ در غیر این صورت، خودرو بهصورت خودکار ترمز میکرد. این چرخه مستمر خواندن و واکنش به ورودیها جایی بود که هوش مصنوعی در آزمون رانندگی با مشکلاتی مواجه شد. مدلها که بهطور بنیادی برای تولید متن طراحی شده بودند، زمان زیادی را به پردازش و تصمیمگیری اختصاص میدادند. برای مثال، مدل Fable از Claude در یک دور ۱۹۰ ثانیهای، تنها ۳۱ ثانیه در حال حرکت بود و بقیه زمان را صرف تفکر و تأمل کرد. این تأخیرها موجب میشد خودرو بدون ورودی مناسب به حرکت درآید و در مواجهه با چالشهای آنی، مانند تشخیص پیچها و تعیین موقعیت صحیح مسیر، ناکارآمد باقی بماند.
GPT-6 Astra؛ تنها موفق در آزمون رانندگی، اما هزینهبر
GPT-6 Astra در تلاش اول خود تا ۴۹ درصد مسیر پیش رفت. در تلاش دوم، این مدل توانست پس از حرکتی آهسته به مدت ۵ دقیقه و ۲۲ ثانیه، مسیر را به پایان برساند. جالب توجه است که آسترا در ۲۰ فرمان از ۲۴ فرمان خود، حداکثر زاویه فرمان را به کار گرفت که نشان میدهد این مدل پس از شکست اولیه، این استراتژی را آموخته بود. این موفقیت برای GPT-6 Astra ارزان تمام نشد؛ هزینه مصرف توکنها برای این دور موفق تصویری برابر با ۷.۷۴ دلار بود که تقریباً چهار برابر هزینه تلاش ناموفق ابتدایی آن به شمار میرفت. در مقایسه، Grok در تلاش سوم خود (که تنها ۲۲ متر را طی کرد و ناکام ماند) بیش از ۵۱۶,۰۰۰ توکن مصرف کرده بود. این آزمایشها به وضوح نشان داد که اگرچه یک مدل هوش مصنوعی میتواند در رانندگی واقعی موفق شود، اما این روش در حال حاضر بسیار کند و پرهزینه است و هنوز فاصله زیادی با سیستمهای خودران تخصصی مانند Waymo دارد.


