Qwen-Drive-1.0 ادراک (perception)، منصوبہ بندی (planning) اور زبان (language) کو ایک ہی ماڈل میں یکجا کرتا ہے، جو خود مختار گاڑیوں (autonomous vehicles) کے انجینئرز کو زبانی یا تحریری ہدایات پر عمل کرنے کی صلاحیت کو قربان کیے بغیر ایک بہتر اور صاف ستھرا اسٹیک (stack) فراہم کرنے کا وعدہ کرتا ہے۔ یہ متحد فن تعمیر (unified architecture) ترقی کی پیچیدگی کو کم کر سکتا ہے جبکہ گاڑیوں کو "آپ نے موڑ کیوں لیا؟" جیسے سوالات کا جواب دینے یا "اگلا ایگزٹ لیں" جیسی ہدایات پر عمل کرنے کے قابل بھی رکھ سکتا ہے۔

ایک متحد بنیاد کیوں اہم ہے

آج کل کا زیادہ تر خودکار ڈرائیونگ سافٹ ویئر الگ الگ ماڈیولز کا مجموعہ ہے: ایک ویژن سسٹم جو کیمرہ اور lidar ڈیٹا کا تجزیہ کرتا ہے، ایک پلانر جو راستے کا فیصلہ کرتا ہے، اور ایک لینگویج انٹرفیس جو صارف کے احکامات یا وضاحتوں کو سنبھالتا ہے۔ ہر حصہ الگ سے تربیت یافتہ ہوتا ہے، اس لیے جب ویژن یا پلاننگ کے حصے غالب ہوتے ہیں تو زبان کا جزو اکثر اپنی سمت سے بھٹک جاتا ہے۔ اس کا نتیجہ ایک ایسی گاڑی کی صورت میں نکلتا ہے جو راستہ تو تلاش کر سکتی ہے لیکن قدرتی زبان کو قابل اعتماد طریقے سے سمجھنے یا تیار کرنے میں ناکام رہتی ہے۔

Qwen-Drive-1.0 اس بکھراؤ کا مقابلہ ایک ہی بیک بون (backbone) کو ایک ساتھ تین کاموں پر تربیت دے کر کرتا ہے—3-D ادراک (perception)، ویژول کویسچن آنسرنگ (VQA)، اور موشن پلاننگ۔ ڈرائیونگ ڈیٹا سیٹس کو عام ویژن-لینگویج کارپوری (corpora) کے ساتھ ملا کر، یہ ماڈل دیکھنے اور عمل کرنے کے ساتھ ساتھ اپنی لسانی معلومات کو بھی برقرار رکھتا ہے۔ یہ "ملٹی ماڈل بنیاد" (multimodal foundation) ان بڑے لسانی ماڈلز (LLMs) کے رجحانات کی عکاسی کرتی ہے جو بہت سے ڈاؤن اسٹریم ایپلی کیشنز کے لیے بنیاد کے طور پر کام کرتے ہیں، لیکن یہ محفوظ نیویگیشن کے لیے ضروری مکانی استدلال (spatial reasoning) کو بھی شامل کرتا ہے۔

ماڈل کا جائزہ کیسے لیا گیا

محققین نے ماڈل کو اوپن لوپ (open-loop) اور کلوزڈ لوپ (closed-loop) دونوں قسم کے ٹیسٹوں سے گزارا۔ اوپن لوپ منظرناموں میں، سسٹم نے ریکارڈ شدہ سینسر اسٹریمز پر کارروائی کی اور ماحول پر اثر انداز ہوئے بغیر پیش گوئیاں کیں؛ کلوزڈ لوپ آزمائشوں میں، اس نے حقیقت میں ایک مصنوعی گاڑی (simulated vehicle) کو کنٹرول کیا۔ ان تمام ترتیبات میں، Qwen-Drive-1.0 کی موشن پلاننگ کی کارکردگی ان ماہر ماڈیولز کے برابر تھی جو صرف ڈرائیونگ پر توجہ مرکوز کرتے ہیں۔ ساتھ ہی، اس کے VQA جزو نے منظر کے بارے میں سوالات کے جوابات دیے، جس سے ثابت ہوا کہ مشترکہ تربیت کے باوجود زبان کی صلاحیت برقرار رہی۔

باقی ماندہ رکاوٹیں

موجودہ کام ایک مکمل سینسر سیٹ تک نہیں پہنچ پایا ہے۔ ہائی ریزولوشن lidar ان پٹس اور طویل فاصلے کی پیش گوئی—جو دونوں ہائی وے ڈرائیونگ کے لیے اہم ہیں—تربیت کے سیٹ میں موجود نہیں ہیں۔ ادراک (perception) بھی ڈیٹا سیٹس کے ایک محدود مجموعے پر انحصار کرتا ہے، جو مختلف موسموں، روشنی اور ٹریفک کے حالات میں اس کے عمومی اطلاق (generalisation) کے بارے میں سوالات اٹھاتا ہے۔ جب تک ماڈل حقیقی دنیا کے ہائی بینڈوتھ سینسر اسٹریمز پر خود کو ثابت نہیں کر دیتا، انجینئرز ثابت شدہ پائپ لائنوں کو تبدیل کرنے میں ہچکچاہٹ محسوس کریں گے۔

اگر یہ طریقہ کار بڑے پیمانے پر اپنایا جائے تو کیا تبدیلیاں آ سکتی ہیں

اگر ایک ہی بنیاد پورے perception-planning-language اسٹیک کو سنبھال سکتی ہے، تو آٹوموٹو ٹیمیں الگ الگ ماڈیولز کے الجھے ہوئے انتظام کو ختم کر سکتی ہیں۔ اس سے انٹیگریشن کی کوششیں کم ہوں گی، ماڈیولز کے درمیان رابطے کی تاخیر (latency) میں کمی آئے گی، اور اپ ڈیٹس کو آسان بنایا جا سکے گا: پلانر کو دوبارہ تربیت دیے بغیر ایک نئی لسانی صلاحیت شامل کی جا سکے گی۔ خود مختار ڈرائیونگ کے لیے بینچ مارک سیٹس کو بھی ارتقاء کی ضرورت ہوگی، جس میں روایتی حفاظت اور کارکردگی کے اسکورز کے ساتھ ساتھ زبان پر مبنی پیمائشیں (metrics) بھی شامل کی جائیں گی۔

دوسرا پہلو: مہارت (specialization) کی اب بھی اہمیت ہے

ماہر ماڈلز اس لیے بہترین کارکردگی دکھاتے ہیں کیونکہ انہیں وسیع پیمانے پر، مخصوص شعبے کے ڈیٹا پر فائن ٹیون (fine-tune) کیا جا سکتا ہے۔ ایک متحد ماڈل شاید lidar-only perception نیٹ ورک یا اربوں میل کے ڈرائیونگ لاگز پر تربیت یافتہ پلانر کی مطلق ترین کارکردگی کا مقابلہ کرنے میں مشکل محسوس کرے۔ حفاظت کے نازک کاموں کے لیے، ریگولیٹرز اور مینوفیکچررز ممکنہ طور پر مخصوص اور مکمل طور پر تصدیق شدہ اجزاء کا مطالبہ جاری رکھ سکتے ہیں۔

آگے کیا دیکھنا ہے

مستقبل کے ورژن سے یہ معلوم ہونا چاہیے کہ آیا Qwen-Drive-1.0 ہائی ریزولوشن lidar کو جذب کر سکتا ہے اور طویل مدت کی پیش گوئی (long-horizon forecasting) کر سکتا ہے۔ حقیقی دنیا کے روڈ ٹیسٹ، خاص طور پر متنوع شہری ماحول میں، اس متحد طریقہ کار کا اصل امتحان ہوں گے۔ اگر یہ آزمائشیں کامیاب ہو گئیں، تو صنعت ملٹی ماڈل بنیادوں کی طرف منتقل ہو سکتی ہے جو خود مختار گاڑیوں میں زبان کو ایک بنیادی اہمیت (first-class citizen) کے طور پر تسلیم کرتی ہیں۔