Qwen-Drive-1.0 परसेप्शन (perception), प्लानिंग (planning) और भाषा को एक ही मॉडल में समेटता है, जो स्वायत्त-वाहन इंजीनियरों को मौखिक या लिखित निर्देशों का पालन करने की क्षमता से समझौता किए बिना एक बेहतर स्टैक का वादा करता है। यह एकीकृत आर्किटेक्चर विकास की जटिलता को कम कर सकता है, जबकि कारों को "आपने मोड़ क्यों लिया?" जैसे सवालों का जवाब देने या "अगला निकास लें" जैसे आदेशों का पालन करने में सक्षम बनाए रख सकता है।

एक एकीकृत आधार (unified foundation) क्यों महत्वपूर्ण है

आज अधिकांश सेल्फ-ड्राइविंग सॉफ़्टवेयर अलग-अलग मॉड्यूल का एक मिश्रण है: एक विज़न सिस्टम जो कैमरा और लिडार डेटा का विश्लेषण करता है, एक प्लानर जो प्रक्षेपवक्र (trajectory) तय करता है, और एक भाषा इंटरफ़ेस जो उपयोगकर्ता के कमांड या स्पष्टीकरण को संभालता है। प्रत्येक हिस्सा अलग से प्रशिक्षित होता है, इसलिए जब विज़न या प्लानिंग वाले हिस्से का प्रभाव (loss) अधिक होता है, तो भाषा घटक अक्सर विचलित हो जाता है। इसका परिणाम एक ऐसा वाहन होता है जो नेविगेट तो कर सकता है लेकिन प्राकृतिक भाषा को विश्वसनीय रूप से समझने या उत्पन्न करने में विफल रहता है।

Qwen-Drive-1.0 एक ही बैकबोन को एक साथ तीन कार्यों पर प्रशिक्षित करके इस विखंडन से निपटता है—3-D परसेप्शन, विजुअल क्वेश्चन आंसरिंग (VQA), और मोशन प्लानिंग। ड्राइविंग डेटासेट को सामान्य विजन-लैंग्वेज कॉर्पोरा के साथ मिलाकर, यह मॉडल देखने और कार्य करने के साथ-साथ अपने भाषाई ज्ञान को भी बनाए रखता है। यह "मल्टीमॉडल फाउंडेशन" उन लार्ज लैंग्वेज मॉडल्स के रुझानों को दर्शाता है जो कई डाउनस्ट्रीम अनुप्रयोगों के लिए आधार के रूप में कार्य करते हैं, लेकिन यह सुरक्षित नेविगेशन के लिए आवश्यक स्थानिक तर्क (spatial reasoning) भी जोड़ता है।

मॉडल का मूल्यांकन कैसे किया गया

शोधकर्ताओं ने मॉडल का ओपन-लूप और क्लोज्ड-लूप दोनों तरह के परीक्षणों के माध्यम से मूल्यांकन किया। ओपन-लूप परिदृश्यों में, सिस्टम ने पर्यावरण को प्रभावित किए बिना रिकॉर्ड किए गए सेंसर स्ट्रीम को प्रोसेस किया और भविष्यवाणियां कीं; क्लोज्ड-लूप परीक्षणों में, इसने वास्तव में एक सिम्युलेटेड वाहन को नियंत्रित किया। इन सेटिंग्स में, Qwen-Drive-1.0 का मोशन-प्लानिंग प्रदर्शन उन विशेषज्ञ मॉडलों के बराबर था जो केवल ड्राइविंग पर ध्यान केंद्रित करते हैं। साथ ही, इसके VQA घटक ने दृश्य के बारे में प्रश्नों के उत्तर दिए, जिससे पता चला कि संयुक्त प्रशिक्षण के बावजूद भाषा की क्षमता बनी रही।

शेष बाधाएं

वर्तमान कार्य एक पूर्ण सेंसर सूट तक नहीं पहुँचा है। हाई-रिज़ॉल्यूशन लिडार इनपुट और लॉन्ग-रेंज प्रेडिक्शन—जो हाईवे ड्राइविंग के लिए दोनों ही महत्वपूर्ण हैं—प्रशिक्षण सेट में अनुपस्थित हैं। परसेप्शन भी डेटासेट के एक सीमित संग्रह पर निर्भर करता है, जिससे विविध मौसम, रोशनी और ट्रैफ़िक स्थितियों में इसके सामान्यीकरण (generalisation) पर सवाल उठते हैं। जब तक मॉडल वास्तविक दुनिया के हाई-बैंडविड्थ सेंसर स्ट्रीम पर खुद को साबित नहीं कर देता, इंजीनियर स्थापित पाइपलाइनों को बदलने में संकोच करेंगे।

यदि यह दृष्टिकोण बड़े पैमाने पर अपनाया जाए तो क्या बदल सकता है

यदि एक ही फाउंडेशन पूरे परसेप्शन-प्लानिंग-लैंग्वेज स्टैक को संभाल सकता है, तो ऑटोमोटिव टीमें अलग-अलग मॉड्यूल के जटिल समन्वय को छोड़ सकती हैं। इससे एकीकरण का प्रयास कम होगा, इंटर-मॉड्यूल संचार से होने वाली लैटेंसी (latency) कम होगी, और अपडेट करना सरल हो जाएगा: प्लानर को पुन: प्रशिक्षित किए बिना एक नई भाषाई क्षमता जोड़ी जा सकती है। स्वायत्त ड्राइविंग के लिए बेंचमार्क सूट्स को भी विकसित करने की आवश्यकता होगी, जिसमें पारंपरिक सुरक्षा और दक्षता स्कोर के साथ-साथ भाषा-केंद्रित मेट्रिक्स भी जोड़े जाएं।

प्रतिवाद: विशेषज्ञता का अभी भी अपना स्थान है

विशेषज्ञ मॉडल इसलिए उत्कृष्ट होते हैं क्योंकि उन्हें विशाल, डोमेन-विशिष्ट डेटा पर फाइन-ट्यून किया जा सकता है। एक एकीकृत मॉडल शायद लिडार-ओनली परसेप्शन नेटवर्क या अरबों मील के ड्राइविंग लॉग पर प्रशिक्षित प्लानर के पूर्ण शिखर प्रदर्शन (peak performance) का मुकाबला करने में संघर्ष कर सकता है। सुरक्षा-महत्वपूर्ण कार्यों के लिए, नियामक और निर्माता समर्पित, व्यापक रूप से मान्य घटकों की मांग करना जारी रख सकते हैं।

आगे क्या देखना है

भविष्य के रिलीज़ से यह पता चलना चाहिए कि क्या Qwen-Drive-1.0 हाई-रिज़ॉल्यूशन लिडार को प्रोसेस कर सकता है और लॉन्ग-होरिज़ॉन फोरकास्टिंग कर सकता है। वास्तविक दुनिया के सड़क परीक्षण, विशेष रूप से विविध शहरी वातावरण में, इस एकीकृत दृष्टिकोण के लिए लिटमस टेस्ट होंगे। यदि वे परीक्षण सफल होते हैं, तो उद्योग मल्टीमॉडल फाउंडेशन की ओर बढ़ सकता है जो स्वायत्त वाहनों में भाषा को एक मुख्य घटक (first-class citizen) के रूप में देखते हैं।