Google DeepMind نے Gemini Robotics 2 کے آغاز کے ساتھ 'embodied AI' کے ایک نئے دور میں باضابطہ طور پر قدم رکھ دیا ہے، جو کہ ایک جدید vision-language-action (VLA) ماڈل ہے۔ یہ انقلابی ٹیکنالوجی ایک عالمگیر ذہانت کی تہہ (universal intelligence layer) کے طور پر کام کرنے کے لیے ڈیزائن کی گئی ہے، جو روبوٹس کو مختلف ہارڈ ویئر پلیٹ فارمز پر مادی دنیا میں حرکت کرنے اور اس کے ساتھ تعامل کرنے کے قابل بناتی ہے۔
Vision-Language-Action (VLA) ماڈلز کا عروج
اس اعلان کا بنیادی مرکز جدید VLA ماڈلز کی طرف منتقلی ہے۔ روایتی روبوٹکس پروگرامنگ کے برعکس، جو سخت اور پہلے سے طے شدہ ہدایات پر انحصار کرتی ہے، Gemini Robotics 2 امیج ریکگنیشن (image recognition)، لینگویج پروسیسنگ (language processing) اور ریئل ٹائم ایکشن کنٹرول کو یکجا کرتا ہے۔ یہ ہم آہنگی ایک روبوٹ کو نہ صرف کسی چیز کو "دیکھنے" اور زبانی حکم کو "سمجھنے" کے قابل بناتی ہے، بلکہ اس چیز کے ساتھ تعامل کرنے کے لیے درکار درست جسمانی حرکات کو انجام دینے کے قابل بھی بناتی ہے۔
DeepMind کا نیا آرکیٹیکچر غیر معمولی طور پر ہمہ گیر ہے، جسے مختلف فارم فیکٹرز کے مطابق ڈھالنے کے لیے ڈیزائن کیا گیا ہے۔ یہ ماڈل مینوفیکچرنگ میں استعمال ہونے والے مخصوص ٹیبل ٹاپ روبوٹک بازوؤں سے لے کر پیچیدہ، مکمل جسمانی ہیومنائیڈ روبوٹس تک ہر چیز کو کنٹرول کرنے کی صلاحیت رکھتا ہے۔ یہ قابلیت ایک ایسے مستقبل کی نشاندہی کرتی ہے جہاں ایک ہی بنیادی ذہانت کو مختلف ہارڈ ویئر پر منتقل کیا جا سکتا ہے، جس سے غیر متوقع ماحول میں جدید روبوٹکس کی تعیناتی میں حائل رکاوٹیں نمایاں طور پر کم ہو جائیں گی۔
Gemini Robotics ER 2: Embodied Reasoning میں پیش رفت
VLA ماڈل کی تکمیل کے لیے Gemini Robotics ER 2 متعارف کرایا گیا ہے، جو خاص طور پر "embodied reasoning" کے لیے تیار کیا گیا ایک ماڈل ہے۔ جہاں VLA ماڈلز ادراک (perception) اور عمل (action) کے چکر پر توجہ مرکوز کرتے ہیں، وہیں ER 2 اعلیٰ سطح کے علمی فیصلہ سازی کے عمل پر توجہ مرکوز کرتا ہے—یعنی ماحول کی مادی باریکیوں کو سمجھنا اور کسی مقصد کے حصول کے لیے اقدامات کے بہترین تسلسل کا تعین کرنا۔
Gemini Robotics ER 2، اپریل میں جاری کردہ Gemini Robotics ER 1.6 ماڈل کا جانشین ہے، جو کہ استدلال (reasoning) کی صلاحیتوں میں ایک اہم چھلانگ ہے۔ ایک اعلیٰ سطح کے کنٹرول سسٹم کے طور پر کام کرتے ہوئے، ER 2 روبوٹس کو سادہ تکراری کاموں سے آگے بڑھ کر حقیقی دنیا کے ماحول میں پیچیدہ مسائل حل کرنے کے قابل بناتا ہے۔ ان صلاحیتوں کو شامل کرنے کے خواہشمند ڈویلپرز کے لیے ER 2 پہلے سے ہی Google AI Studio کے ذریعے دستیاب ہے۔
یہ AI کے منظر نامے کے لیے کیوں اہم ہے
Gemini Robotics 2 کی ترقی جنرل پرپز روبوٹکس (General Purpose Robotics) کی تلاش میں ایک اہم قدم ہے۔ برسوں سے، صنعت "brittleness" (نازک پن) کے مسئلے سے لڑ رہی ہے—یعنی ماحول میں معمولی تبدیلی آنے پر روبوٹس کے ناکام ہونے کا رجحان۔ Gemini فیملی کے اسکیلنگ قوانین (scaling laws) اور ٹرانسفارمر پر مبنی منطق کو جسمانی حرکت پر لاگو کر کے، DeepMind مطابقت پذیری (adaptability) کے مسئلے کو حل کرنے کے لیے کام کر رہا ہے۔
اگر یہ کامیاب رہا، تو یہ "intelligence layer" کا طریقہ کار سافٹ ویئر کی ذہانت کو ہارڈ ویئر انجینئرنگ سے الگ کر سکتا ہے۔ اس سے روبوٹکس کی تعیناتی میں تیزی آئے گی، کیونکہ ڈویلپرز جسمانی ایکچوایٹرز (actuators) کو بہتر بنانے پر توجہ مرکوز کر سکیں گے جبکہ حرکت اور مکانی استدلال (spatial reasoning) کی پیچیدہ منطق کو سنبھالنے کے لیے گوگل کے مضبوط، پہلے سے تربیت یافتہ ماڈلز پر بھروسہ کر سکیں گے۔
اہم نکات
- عالمگیر مطابقت (Universal Compatibility): Gemini Robotics 2 ایک VLA ماڈل ہے جو چھوٹے ٹیبل ٹاپ بازوؤں سے لے کر پیچیدہ ہیومنائیڈ روبوٹس تک مختلف ہارڈ ویئر کو کنٹرول کرنے کی صلاحیت رکھتا ہے۔
- بہتر استدلال (Enhanced Reasoning): نیا Gemini Robotics ER 2 جدید "embodied reasoning" فراہم کرتا ہے، جو جسمانی فیصلہ سازی کے لیے ایک اعلیٰ سطح کے علمی کنٹرولر کے طور پر کام کرتا ہے۔
- ڈویلپرز کے لیے رسائی (Developer Accessibility): گوگل ان ٹولز کو ایکوسسٹم کے لیے کھول رہا ہے، جس میں ER 2 گوگل AI Studio میں دستیاب ہے اور Gemini Robotics 2 تک جلد رسائی ویٹ لسٹ کے ذریعے حاصل کی جا سکتی ہے۔
خلاصہ
Gemini Robotics 2 اور اس کے ساتھ منسلک ER 2 ماڈیول روبوٹس کے لیے ایک عالمگیر AI دماغ کی طرف ایک ٹھوس قدم ہے، جو ادراک، زبان اور کنٹرول کو ایک ہی قابلِ تربیت نظام میں یکجا کر دیتا ہے۔ یہ طریقہ کار جدید روبوٹس کی تعیناتی کی لاگت اور پیچیدگی کو نمایاں طور پر کم کر سکتا ہے۔
