اس ماہ Hugging Face کے پیپرز کی درجہ بندی سے ظاہر ہوتا ہے کہ یہ شعبہ تیزی سے ترقی کر رہا ہے۔ نمایاں کام صرف پیرامیٹرز کی تعداد بڑھانے کے بارے میں نہیں ہے، بلکہ ماڈلز کو دیکھنے، یاد رکھنے اور اپنے کام مکمل کرنے کے قابل بنانے کے بارے میں ہے۔ نیچے دیے گئے دس پیپرز ریئل ٹائم ویڈیو، روبوٹک ادراک (robot cognition)، ایماندارانہ بینچ مارکنگ، اور جنریٹرز کو اساتذہ کے طور پر استعمال کرنے کے خاموش انقلاب پر روشنی ڈالتے ہیں۔

ریئل ٹائم ویڈیو جسے آپ حقیقت میں استعمال کر سکتے ہیں

زیادہ تر ویڈیو ماڈلز اب بھی مہنگے لیبارٹری تجربات کی طرح کام کرتے ہیں۔ وہ بھاری ہارڈ ویئر پر منٹوں تک چلتے ہیں اور ایسے کلپس تیار کرتے ہیں جنہیں آپ عمل کے دوران کنٹرول نہیں کر سکتے۔ Vidu S1 اس صورتحال کو بدل دیتا ہے۔ یہ ریئل ٹائم انٹرایکشن کو نشانہ بناتا ہے، جس سے صارفین وائس کمانڈز کے ذریعے ڈیجیٹل کرداروں کو ہدایت دے سکتے ہیں، جبکہ ماڈل TurboDiffusion نامی تکنیک کے ذریعے عام کنزیومر GPUs پر چلتا ہے۔

ہارڈ ویئر میں یہ تبدیلی اہم ہے۔ جب کسی ماڈل کو اب اعلیٰ درجے کے ایکسرلیٹرز کے پورے ریک کی ضرورت نہیں رہتی، تو وہ محض ایک ڈیمو نہیں رہتا بلکہ انفراسٹرکچر بن جاتا ہے۔ ان لائیو اسٹریم کرنے والے اوتاروں کے بارے میں سوچیں جو ریئل ٹائم میں چیٹ پر ردعمل دیتے ہیں، یا کسٹمر سروس کے کردار جو ضرورت پڑنے پر نظریں ملا سکتے ہیں اور لہجہ بدل سکتے ہیں۔ Vidu S1 ایسی ویڈیو AI کی طرف اشارہ کرتا ہے جو محض ایک تحقیقی پری پرنٹ نہیں بلکہ ایک مکمل پروڈکٹ کے طور پر دستیاب ہو۔

روبوٹس جو ہدایات سمجھتے ہیں

فزیکل AI کے لیے نیویگیشن اب بھی ایک بنیادی رکاوٹ ہے۔ ABot-N1 عام لسانی ہدایات کے ذریعے روبوٹک نیویگیشن کے لیے ایک فاؤنڈیشن ماڈل تجویز کر کے اس مسئلے کا حل نکالتا ہے۔ کمزور اور پہلے سے نقشہ شدہ راستوں کے بجائے، یہ سسٹم جو کچھ دیکھتا اور سنتا ہے اس میں پیٹرنز کو پہچان کر مختلف ماحول میں حرکت کرنا سیکھتا ہے۔

اس کا فوری فائدہ لاجسٹکس میں نظر آتا ہے۔ ایک ڈیلیوری روبوٹ کو اگر ایسی زبانی ہدایت دی جائے کہ "بائیک ریک کے پاس والے سائیڈ اینٹرنس پر پیکج چھوڑ دیں"، تو وہ اس ہدایت کو سمجھ سکتا ہے اور ریک کی جگہ بدلنے پر خود کو ڈھال سکتا ہے۔ ہوم اسسٹنٹس کو بھی اسی طرح کی لچک حاصل ہوگی، جو پہلے سے اپ لوڈ کیے گئے درست فلور پلان کے بغیر اپارٹمنٹس میں گھوم سکیں گے۔

روبوٹس جو کل کی باتیں یاد رکھتے ہیں

ABot-AgentOS اس نیویگیشن کے کام کے ساتھ مل کر ایک مختلف مسئلے کو حل کرتا ہے: روبوٹس عام طور پر ہر کمانڈ کے بعد ری سیٹ ہو جاتے ہیں۔ یہ سسٹم مشین کو صارفین، اشیاء اور روزمرہ کی عادات کے لیے طویل مدتی یادداشت رکھنے والے ایک مستقل ایجنٹ کے طور پر استعمال کرتا ہے۔

ایک بار کے کام کرنے والے پروسیسر اور ایک مسلسل کام کرنے والے ایجنٹ کے درمیان فرق ایک اوزار اور ایک ساتھی کے درمیان فرق کی طرح ہے۔ ویئر ہاؤس آٹومیشن میں، یادداشت رکھنے والا روبوٹ یہ نوٹ کرتا ہے کہ منگل کی ترسیلات میں ہمیشہ نازک اشیاء شامل ہوتی ہیں اور وہ اپنی گرفت کو اس کے مطابق ڈھال لیتا ہے۔ گھروں میں دیکھ بھال کے لیے، اسے یاد رہتا ہے کہ ایک مخصوص رہائشی شام 3 بجے پردوں کو آدھا کھلا رکھنا پسند کرتا ہے۔ یہ تسلسل بڑے پیمانے پر پرسنلائزیشن کو ممکن بناتا ہے۔

ویڈیو بینچ مارکس کی حقیقت بے نقاب کرنا

Video-Oasis ایک تکلیف دہ حقیقت سامنے لاتا ہے: ویڈیو سمجھنے کے بہت سے مقبول بینچ مارکس ناکام ہیں۔ ماڈلز اکثر صرف ٹیکسٹ کے علم کو استعمال کرتے ہوئے سوالات کے جواب دیتے ہیں اور اصل فریمز کو دیکھنے کی زحمت بھی نہیں کرتے۔ یہ پیپر ثابت کرتا ہے کہ موجودہ بینچ مارک کے آدھے سوالات کسی بھی بصری ان پٹ کے بغیر حل کیے جا سکتے ہیں۔

اس کا مطلب ہے کہ محققین ہوشیار اندازے لگانے والوں کو انعام دے رہے ہیں، نہ کہ حقیقی ادراک کرنے والوں کو۔ کمیونٹی کو ایسے ایویلیوایشن پروٹوکولز کی ضرورت ہے جو ماڈلز کو ہر جواب کو پکسل لیول کے ثبوتوں پر مبنی کرنے پر مجبور کریں۔ ورنہ ہم ایسے سسٹم لانچ کرنے کا خطرہ مول لے رہے ہیں جو روشنی بدلنے پر پراعتماد طریقے سے غلط معلومات فراہم کرتے ہیں۔

کوڈنگ ایجنٹس جو طویل کام مکمل کرتے ہیں

کوڈنگ اسسٹنٹس کوڈ کے چھوٹے ٹکڑے (snippets) تو اچھے لکھ لیتے ہیں، لیکن سو مراحل والے DevOps ورک فلو اب بھی ایک مشکل چیلنج ہیں۔ Long-Horizon-Terminal-Bench اس بات کا امتحان لیتا ہے کہ ایجنٹس طویل کاموں کو کیسے سنبھالتے ہیں، کام کے دوران ہونے والی غلطیوں سے کیسے نکلتے ہیں، اور انسانی مدد کے بغیر دوبارہ منصوبہ بندی کیسے کرتے ہیں۔

یہ ان لوگوں کے لیے اہم ہے جو خود مختار سسٹم ایڈمنسٹریشن کا خواب دیکھتے ہیں۔ ایک ایسا ایجنٹ جو سرور کو پیچ (patch) کر سکے، ڈیپینڈینسیز پر تشخیص (diagnostics) کر سکے، اور اگر کوئی مرحلہ ناکام ہو جائے تو اسے واپس (roll back) کر سکے، اس ایجنٹ سے کہیں زیادہ قیمتی ہے جو بہترین Python تو لکھتا ہے لیکن پہلی گمشدہ API key پر رک جاتا ہے۔ یہ بینچ مارک محققین کو اس طرح کی استقامت کے لیے ایک اسکور بورڈ فراہم کرتا ہے۔

سستا Reinforcement Learning

Direct OPD Reinforcement Learning میں لاگت کے مسئلے کو حل کرتا ہے۔ بڑے ماڈلز کے لیے RL بہت زیادہ پیسہ اور GPU کے گھنٹے خرچ کرتا ہے۔ تجویز کردہ شارٹ کٹ سادہ ہے: پہلے ایک چھوٹے ماڈل کو RL کے ساتھ تربیت دیں، پھر اس سیکھی ہوئی پالیسی کو ایک بڑے ماڈل میں منتقل کر دیں۔

چھوٹے ایکسپلوررز سستی غلطیاں کرتے ہیں۔ ایک بار جب حکمت عملی کی تصدیق ہو جاتی ہے، تو بڑا ماڈل پوری قیمت ادا کیے بغیر ان اسباق کو اپنا لیتا ہے۔ ان مختصر ٹیموں کے لیے جو بڑے لینگویج ماڈلز کو الائن کرنے یا ایجنٹس کو فائن ٹیون کرنے کی کوشش کر رہی ہیں،