Qwen-Drive-1.0 ادراک، برنامه‌ریزی و زبان را در قالب یک مدل واحد تجمیع می‌کند و به مهندسان خودروهای خودران وعده یک ساختار (stack) تمیزتر را می‌دهد، بدون اینکه توانایی پیروی از دستورات گفتاری یا متنی را فدا کند. این معماری یکپارچه می‌تواند پیچیدگی توسعه را کاهش دهد و در عین حال خودرو را قادر سازد تا به سوالاتی مانند «چرا پیچیدی؟» پاسخ دهد یا دستوراتی مثل «از خروجی بعدی خارج شو» را اجرا کند.

چرا یک پایه (foundation) یکپارچه اهمیت دارد

بیشتر نرم‌افزارهای خودران امروزی مجموعه‌ای از ماژول‌های مجزا هستند: یک سیستم بینایی که داده‌های دوربین و لیدار (lidar) را تجزیه می‌کند، یک برنامه‌ریز (planner) که مسیر را تعیین می‌کند، و یک رابط زبانی که دستورات یا توضیحات کاربر را مدیریت می‌کند. هر بخش به صورت مجزا آموزش می‌بیند، بنابراین مؤلفه زبانی اغلب زمانی که بخش‌های بینایی یا برنامه‌ریزی بر تابع زیان (loss) غلبه می‌کنند، دچار انحراف می‌شود. نتیجه، خودرویی است که می‌تواند مسیریابی کند اما در درک یا تولید قابل اعتماد زبان طبیعی ناتوان است.

Qwen-Drive-1.0 با آموزش یک ستون فقرات (backbone) واحد برای سه وظیفه به طور همزمان — ادراک سه‌بعدی، پاسخگویی به سوالات بصری (VQA) و برنامه‌ریزی حرکت — با این تکه‌تکه بودن مقابله می‌کند. با ترکیب مجموعه‌داده‌های رانندگی با پیکره‌های عمومی بینایی-زبانی، این مدل دانش زبانی خود را حفظ کرده و همزمان یاد می‌گیرد که ببیند و عمل کند. این «پایه چندوجهی» (multimodal foundation) بازتاب‌دهنده روندهای مدل‌های زبانی بزرگ است که به عنوان پایه برای بسیاری از کاربردهای پایین‌دستی عمل می‌کنند، اما استدلال فضایی مورد نیاز برای مسیریابی ایمن را نیز به آن اضافه می‌کند.

مدل چگونه ارزیابی شد

محققان مدل را در هر دو آزمون حلقه-باز (open-loop) و حلقه-بسته (closed-loop) مورد آزمایش قرار دادند. در سناریوهای حلقه-باز، سیستم جریان‌های حسگر ضبط‌شده را پردازش کرده و بدون تأثیرگذاری بر محیط، پیش‌بینی‌هایی تولید می‌کرد؛ در آزمایش‌های حلقه-بسته، سیستم در واقع یک خودروی شبیه‌سازی شده را کنترل می‌کرد. در تمامی این تنظیمات، عملکرد برنامه‌ریزی حرکت Qwen-Drive-1.0 با مدل‌های تخصصی که صرفاً بر رانندگی تمرکز دارند، برابری کرد. در عین حال، مؤلفه VQA آن به پرسش‌ها درباره صحنه پاسخ داد که نشان می‌دهد توانایی زبانی در طول آموزش مشترک حفظ شده است.

موانع باقی‌مانده

کار فعلی هنوز به یک مجموعه کامل از حسگرها نرسیده است. ورودی‌های لیدار با وضوح بالا و پیش‌بینی‌های برد بلند — که هر دو برای رانندگی در بزرگراه حیاتی هستند — در مجموعه آموزشی حضور ندارند. همچنین ادراک بر مجموعه محدودی از مجموعه‌داده‌ها متکی است که سوالاتی را در مورد تعمیم‌پذیری به شرایط مختلف آب و هوا، نور و ترافیک ایجاد می‌کند. تا زمانی که این مدل خود را در جریان‌های حسگر واقعی با پهنای باند بالا ثابت نکند، مهندسان برای جایگزینی خط‌لوله‌های (pipelines) اثبات‌شده تردید خواهند داشت.

اگر این رویکرد مقیاس‌پذیر شود، چه چیزی می‌تواند تغییر کند

اگر یک پایه واحد بتواند کل پشته‌ی ادراک-برنامه‌ریزی-زبان را مدیریت کند، تیم‌های خودروسازی می‌توانند سازماندهی پیچیده ماژول‌های مجزا را کنار بگذارند. این امر تلاش برای یکپارچه‌سازی را کاهش می‌دهد، تأخیر ناشی از ارتباط بین ماژول‌ها را کم می‌کند و به‌روزرسانی‌ها را ساده می‌سازد: یک قابلیت زبانی جدید می‌تواند بدون نیاز به آموزش مجدد برنامه‌ریز اضافه شود. مجموعه‌های معیار (benchmark) برای رانندگی خودران نیز باید تکامل یابند و معیارهای زبان‌محور را در کنار امتیازات سنتی ایمنی و کارایی اضافه کنند.

دیدگاه مقابل: تخصص همچنان جایگاه خود را دارد

مدل‌های تخصصی به این دلیل برتری دارند که می‌توان آن‌ها را بر روی داده‌های عظیم و دامنه-محور تنظیم دقیق (fine-tune) کرد. یک مدل یکپارچه ممکن است برای رسیدن به اوج عملکرد مطلق یک شبکه ادراکیِ صرفاً مبتنی بر لیدار یا یک برنامه‌ریز آموزش‌دیده بر اساس میلیاردها مایل گزارش‌های رانندگی، با چالش روبرو شود. برای عملکردهای حساس به ایمنی، رگولاتورها و تولیدکنندگان ممکن است همچنان تقاضای اجزای اختصاصی و به دقت اعتبارسنجی‌شده را داشته باشند.

آنچه باید در آینده زیر نظر داشت

نسخه‌های آینده باید نشان دهند که آیا Qwen-Drive-1.0 می‌تواند لیدار با وضوح بالا را دریافت کرده و پیش‌بینی‌های بلندمدت انجام دهد یا خیر. تست‌های جاده‌ای در دنیای واقعی، به ویژه در محیط‌های شهری متنوع، آزمون اصلی برای این رویکرد یکپارچه خواهد بود. اگر این آزمایش‌ها موفقیت‌آمیز باشند، صنعت می‌تواند شاهد تغییری به سمت پایه‌های چندوجهی باشد که در آن‌ها زبان به عنوان یک رکن اصلی در خودروهای خودران در نظر گرفته می‌شود.