يجمع Qwen-Drive-1.0 بين الإدراك والتخطيط واللغة في نموذج واحد، مما يعد مهندسي المركبات ذاتية القيادة بمجموعة برمجية أكثر سلاسة دون التضحية بالقدرة على اتباع التعليمات المنطوقة أو النصية. يمكن للهندسة الموحدة أن تقلل من تعقيد التطوير مع الحفاظ على قدرة السيارات على الإجابة على سؤال "لماذا انعطفت؟" أو الامتثال لأمر "اتخذ المخرج التالي".

لماذا تُعد القاعدة الموحدة أمراً مهماً

معظم برمجيات القيادة الذاتية اليوم هي عبارة عن مزيج من وحدات منفصلة: نظام رؤية يحلل بيانات الكاميرا والليدار (lidar)، ومخطط يقرر المسار، وواجهة لغوية تتعامل مع أوامر المستخدم أو التفسيرات. يتم تدريب كل جزء بشكل منعزل، لذا غالباً ما ينحرف المكون اللغوي عندما تهيمن أجزاء الرؤية أو التخطيط على عملية تقليل الخسارة (loss). والنتيجة هي مركبة يمكنها التنقل ولكنها تفشل في فهم أو توليد اللغة الطبيعية بشكل موثوق.

يعالج Qwen-Drive-1.0 هذا التجزؤ من خلال تدريب هيكل أساسي (backbone) واحد على ثلاث مهام في آن واحد: الإدراك ثلاثي الأبعاد (3-D perception)، والإجابة على الأسئلة المرئية (VQA)، وتخطيط الحركة. ومن خلال دمج مجموعات بيانات القيادة مع مجموعات بيانات الرؤية واللغة العامة، يحتفظ النموذج بمعرفته اللغوية أثناء تعلم الرؤية والتصرف. تعكس هذه "القاعدة متعددة الوسائط" (multimodal foundation) الاتجاهات السائدة في النماذج اللغوية الكبيرة التي تعمل كأساس للعديد من التطبيقات اللاحقة، لكنها تضيف التفكير المكاني اللازم للملاحة الآمنة.

كيف تم تقييم النموذج

أجرى الباحثون اختبارات للنموذج عبر حلقات مفتوحة (open-loop) وحلقات مغلقة (closed-loop). في سيناريوهات الحلقة المفتوحة، عالج النظام تدفقات المستشعرات المسجلة وأصدر تنبؤات دون التأثير على البيئة؛ أما في تجارب الحلقة المغلقة، فقد قام فعلياً بالتحكم في مركبة محاكاة. وعبر هذه الإعدادات، طابقت أداء تخطيط الحركة في Qwen-Drive-1.0 النماذج المتخصصة التي تركز فقط على القيادة. وفي الوقت نفسه، أجاب مكون VQA الخاص به على الاستفسارات المتعلقة بالمشهد، مما أظهر أن القدرة اللغوية صمدت خلال التدريب المشترك.

العقبات المتبقية

يتوقف العمل الحالي دون الوصول إلى مجموعة مستشعرات كاملة. فمدخلات الليدار (lidar) عالية الدقة والتنبؤ بعيد المدى — وكلاهما ضروري للقيادة على الطرق السريعة — غائبان عن مجموعة التدريب. كما يعتمد الإدراك على مجموعة محدودة من مجموعات البيانات، مما يثير تساؤلات حول القدرة على التعميم في ظروف الطقس والإضاءة وحركة المرور المتنوعة. وإلى أن يثبت النموذج نفسه في تدفقات مستشعرات حقيقية وعالية النطاق الترددي، سيتردد المهندسون في استبدال المسارات البرمجية (pipelines) المجربة.

ما الذي قد يتغير إذا توسع هذا النهج

إذا تمكنت قاعدة واحدة من التعامل مع كامل حزمة الإدراك والتخطيط واللغة، فقد تتخلى فرق صناعة السيارات عن التنسيق المعقد للوحدات المنفصلة. من شأن ذلك أن يقلل من جهد التكامل، ويخفض زمن الاستجابة الناتج عن التواصل بين الوحدات، ويبسط عمليات التحديث: حيث يمكن إضافة قدرة لغوية جديدة دون الحاجة إلى إعادة تدريب المخطط. كما ستحتاج مجموعات اختبارات القيادة الذاتية إلى التطور، عبر إضافة مقاييس تركز على اللغة إلى جانب درجات السلامة والكفاءة التقليدية.

وجهة نظر مغايرة: التخصص لا يزال له مكان

تتفوق النماذج المتخصصة لأنها يمكن ضبطها بدقة (fine-tuned) باستخدام بيانات ضخمة خاصة بمجال معين. قد يواجه النموذج الموحد صعوبة في مضاهاة ذروة الأداء المطلقة لشبكة إدراك تعتمد على الليدار فقط، أو مخطط تم تدريبه على مليارات الأميال من سجلات القيادة. وبالنسبة للوظائف الحساسة للسلامة، قد يستمر المنظمون والمصنعون في المطالبة بمكونات مخصصة ومحققة بدقة.

ما الذي يجب مراقبته لاحقاً

يجب أن تكشف الإصدارات المستقبلية عما إذا كان بإمكان Qwen-Drive-1.0 استيعاب بيانات الليدار عالية الدقة وإجراء تنبؤات طويلة المدى. وستكون اختبارات الطرق في العالم الحقيقي، خاصة في البيئات الحضرية المتنوعة، هي الاختبار الحقيقي لهذا النهج الموحد. وإذا نجحت تلك التجارب، فقد يشهد القطاع تحولاً نحو القواعد متعددة الوسائط التي تعامل اللغة كعنصر أساسي في المركبات ذاتية القيادة.