Qwen-Drive-1.0 ادراک، برنامهریزی و زبان را در قالب یک مدل واحد تجمیع میکند و به مهندسان خودروهای خودران وعده یک ساختار (stack) تمیزتر را میدهد، بدون اینکه توانایی پیروی از دستورات گفتاری یا متنی را فدا کند. این معماری یکپارچه میتواند پیچیدگی توسعه را کاهش دهد و در عین حال خودرو را قادر سازد تا به سوالاتی مانند «چرا پیچیدی؟» پاسخ دهد یا دستوراتی مثل «از خروجی بعدی خارج شو» را اجرا کند.
چرا یک پایه (foundation) یکپارچه اهمیت دارد
بیشتر نرمافزارهای خودران امروزی مجموعهای از ماژولهای مجزا هستند: یک سیستم بینایی که دادههای دوربین و لیدار (lidar) را تجزیه میکند، یک برنامهریز (planner) که مسیر را تعیین میکند، و یک رابط زبانی که دستورات یا توضیحات کاربر را مدیریت میکند. هر بخش به صورت مجزا آموزش میبیند، بنابراین مؤلفه زبانی اغلب زمانی که بخشهای بینایی یا برنامهریزی بر تابع زیان (loss) غلبه میکنند، دچار انحراف میشود. نتیجه، خودرویی است که میتواند مسیریابی کند اما در درک یا تولید قابل اعتماد زبان طبیعی ناتوان است.
Qwen-Drive-1.0 با آموزش یک ستون فقرات (backbone) واحد برای سه وظیفه به طور همزمان — ادراک سهبعدی، پاسخگویی به سوالات بصری (VQA) و برنامهریزی حرکت — با این تکهتکه بودن مقابله میکند. با ترکیب مجموعهدادههای رانندگی با پیکرههای عمومی بینایی-زبانی، این مدل دانش زبانی خود را حفظ کرده و همزمان یاد میگیرد که ببیند و عمل کند. این «پایه چندوجهی» (multimodal foundation) بازتابدهنده روندهای مدلهای زبانی بزرگ است که به عنوان پایه برای بسیاری از کاربردهای پاییندستی عمل میکنند، اما استدلال فضایی مورد نیاز برای مسیریابی ایمن را نیز به آن اضافه میکند.
مدل چگونه ارزیابی شد
محققان مدل را در هر دو آزمون حلقه-باز (open-loop) و حلقه-بسته (closed-loop) مورد آزمایش قرار دادند. در سناریوهای حلقه-باز، سیستم جریانهای حسگر ضبطشده را پردازش کرده و بدون تأثیرگذاری بر محیط، پیشبینیهایی تولید میکرد؛ در آزمایشهای حلقه-بسته، سیستم در واقع یک خودروی شبیهسازی شده را کنترل میکرد. در تمامی این تنظیمات، عملکرد برنامهریزی حرکت Qwen-Drive-1.0 با مدلهای تخصصی که صرفاً بر رانندگی تمرکز دارند، برابری کرد. در عین حال، مؤلفه VQA آن به پرسشها درباره صحنه پاسخ داد که نشان میدهد توانایی زبانی در طول آموزش مشترک حفظ شده است.
موانع باقیمانده
کار فعلی هنوز به یک مجموعه کامل از حسگرها نرسیده است. ورودیهای لیدار با وضوح بالا و پیشبینیهای برد بلند — که هر دو برای رانندگی در بزرگراه حیاتی هستند — در مجموعه آموزشی حضور ندارند. همچنین ادراک بر مجموعه محدودی از مجموعهدادهها متکی است که سوالاتی را در مورد تعمیمپذیری به شرایط مختلف آب و هوا، نور و ترافیک ایجاد میکند. تا زمانی که این مدل خود را در جریانهای حسگر واقعی با پهنای باند بالا ثابت نکند، مهندسان برای جایگزینی خطلولههای (pipelines) اثباتشده تردید خواهند داشت.
اگر این رویکرد مقیاسپذیر شود، چه چیزی میتواند تغییر کند
اگر یک پایه واحد بتواند کل پشتهی ادراک-برنامهریزی-زبان را مدیریت کند، تیمهای خودروسازی میتوانند سازماندهی پیچیده ماژولهای مجزا را کنار بگذارند. این امر تلاش برای یکپارچهسازی را کاهش میدهد، تأخیر ناشی از ارتباط بین ماژولها را کم میکند و بهروزرسانیها را ساده میسازد: یک قابلیت زبانی جدید میتواند بدون نیاز به آموزش مجدد برنامهریز اضافه شود. مجموعههای معیار (benchmark) برای رانندگی خودران نیز باید تکامل یابند و معیارهای زبانمحور را در کنار امتیازات سنتی ایمنی و کارایی اضافه کنند.
دیدگاه مقابل: تخصص همچنان جایگاه خود را دارد
مدلهای تخصصی به این دلیل برتری دارند که میتوان آنها را بر روی دادههای عظیم و دامنه-محور تنظیم دقیق (fine-tune) کرد. یک مدل یکپارچه ممکن است برای رسیدن به اوج عملکرد مطلق یک شبکه ادراکیِ صرفاً مبتنی بر لیدار یا یک برنامهریز آموزشدیده بر اساس میلیاردها مایل گزارشهای رانندگی، با چالش روبرو شود. برای عملکردهای حساس به ایمنی، رگولاتورها و تولیدکنندگان ممکن است همچنان تقاضای اجزای اختصاصی و به دقت اعتبارسنجیشده را داشته باشند.
آنچه باید در آینده زیر نظر داشت
نسخههای آینده باید نشان دهند که آیا Qwen-Drive-1.0 میتواند لیدار با وضوح بالا را دریافت کرده و پیشبینیهای بلندمدت انجام دهد یا خیر. تستهای جادهای در دنیای واقعی، به ویژه در محیطهای شهری متنوع، آزمون اصلی برای این رویکرد یکپارچه خواهد بود. اگر این آزمایشها موفقیتآمیز باشند، صنعت میتواند شاهد تغییری به سمت پایههای چندوجهی باشد که در آنها زبان به عنوان یک رکن اصلی در خودروهای خودران در نظر گرفته میشود.
