ایک کراس موڈل نالج ڈسٹلیشن فریم ورک نے کثیر لسانی عملے کے لیے سافٹ روبوٹکس کی دیکھ بھال کے وقت میں 34% کی کمی کی، انفرینس انجن کو 60% تک چھوٹا کیا اور 45 ملی سیکنڈ سے بھی کم وقت میں ہدایات فراہم کیں۔ یہ پیش رفت اس لیے اہم ہے کیونکہ سافٹ روبوٹ—جو لچکدار پولیمر اور فلوئڈک ایکچوایٹرز سے بنے ہوتے ہیں—مینوفیکچرنگ، طبی آلات اور خطرناک مقامات پر پھیل رہے ہیں، تاہم لسانی رکاوٹیں اور بکھری ہوئی سینسر اسٹریمز ان کی دیکھ بھال میں رکاوٹ بنتی ہیں۔

سافٹ روبوٹکس کی دیکھ بھال ایک ملٹی موڈل مسئلہ کیوں ہے

سافٹ روبوٹ دھاتی بازوؤں سے مختلف ہوتے ہیں: ایلاسٹومرز، سلیکون اسکن اور اندرونی چینلز مائع پمپ کرتے ہیں۔ میمبرین میں دراڑ، نیومیٹک لائن میں رساؤ، یا پمپ کی آواز میں معمولی تبدیلی، یہ سب کسی فوری ناکامی کا اشارہ ہو سکتے ہیں۔ ان علامات کی نشاندہی کے لیے ایک سے زیادہ ڈیٹا ذرائع کی ضرورت ہوتی ہے۔

  • بصری (Visual) فیڈز سطح کی تبدیلیوں یا رنگ میں تبدیلی کو ظاہر کرتے ہیں۔
  • لمسی (Tactile) سینسرز غیر متوقع لچک یا پھسلن کی اطلاع دیتے ہیں۔
  • آواز (Acoustic) مائیکروفونز پمپ کی غیر معمولی فریکوئنسی کو ریکارڈ کرتے ہیں۔
  • لسانی (Linguistic) ان پٹس تکنشیان کی مادری زبان میں مرمت کے طریقہ کار بتاتے ہیں۔

جب ایک ہسپانوی بولنے والے آپریٹر نے ایک معیاری ترجمہ ماڈل سے صرف انگریزی میں دی گئی ہدایات پر عمل کیا، تو ماڈل نے متن تو درست طریقے سے پیش کیا لیکن بڑھتی ہوئی دراڑ کے بصری اشارے کو نظر انداز کر دیا۔ اس کے نتیجے میں مرمت میں تاخیر ہوئی اور پلانٹ بند ہونے سے مالی نقصان ہوا۔ اس واقعے نے تین باہم مربوط چیلنجز کو بے نقاب کیا: غیر مطابقت پذیر موڈالٹیز، ایسی تکنیکی اصطلاحات جن کا لفظی ترجمہ مشکل ہو، اور ریئل ٹائم شاپ فلور فیڈ بیک کی ضرورت۔

کراس موڈل نالج ڈسٹلیشن کیسے کام کرتی ہے

محققین نے ایک ہی بڑے (monolithic) AI کو "ٹیچر" ماڈلز کے ایک مجموعے سے بدل دیا، جن میں سے ہر ایک ایک مخصوص موڈالٹی کا ماہر ہے، اور ایک ہلکا پھلکا "اسٹوڈنٹ" ماڈل تیار کیا جو ان کے مشاہدات کو یکجا کرتا ہے۔ اس پائپ لائن کے تین مراحل ہیں:

  1. موڈالٹی مخصوص ٹیچرز – الگ الگ نیورل نیٹ ورکس جو بصری (vision)، آڈیو اور ٹیکسٹ کارپوری پر تربیت یافتہ ہیں۔ بصری ٹیچر دراڑیں تلاش کرتا ہے، آڈیو ٹیچر پمپ کی غیر معمولی آوازوں کو نشان زد کرتا ہے، اور لسانی ٹیچر تکنیکی مینوئلز کا تجزیہ کرتا ہے۔
  2. الائنمنٹ ماڈیول – ایک نیورل برج جو مختلف قسم کے آؤٹ پٹس کو ایک مشترکہ ایمبیڈنگ اسپیس میں منتقل کرتا ہے۔ کونٹراسٹو لرننگ (Contrastive learning) سسٹم کو مجبور کرتی ہے کہ وہ، مثال کے طور پر، ایک بصری دراڑ کو اس کے صوتی اثر (acoustic signature) کے ساتھ جوڑے، تاکہ ایمبیڈنگز کراس موڈل سیمنٹکس کو سمجھ سکیں۔
  3. کثیر لسانی اسٹوڈنٹ – ایک جامع ماڈل جو الائن شدہ ایمبیڈنگز کو استعمال کرتا ہے اور کسی بھی معاون زبان میں مرمت کی ہدایات تیار کرتا ہے۔ ایک ڈومین مخصوص نالج گراف "pneumatic diaphragm" یا "hydrogel actuator" جیسی مخصوص اصطلاحات کے لیے درست ترجمہ فراہم کرتا ہے۔

کوانٹائزیشن (Quantization)—یعنی ویٹ پریسیشن کو کم کرنا—اسٹوڈنٹ ماڈل کے سائز کو 60% تک کم کر دیتی ہے، جس سے اسے کم کمپیوٹنگ صلاحیت والے ایج ڈیوائسز پر چلانا ممکن ہو جاتا ہے۔ اس کے نتیجے میں حاصل ہونے والی 45 ملی سیکنڈ کی انفرینس لیٹنسی اس آپریٹر کی ریئل ٹائم ضروریات کو پورا کرتی ہے جو پمپ کے شور کو سنتے ہوئے لائیو کیمرہ فیڈ دیکھ رہا ہو۔

کارکردگی میں اضافہ اور حقیقی دنیا پر اثرات

اس فریم ورک کا تجربہ ایک پارٹنر سہولت میں کیا گیا۔

  • وقت کی بچت: کثیر لسانی ٹیموں نے معمول کے چیک اپ 34% تیزی سے مکمل کیے، جس کی وجہ فوری اور زبان کے مطابق فراہم کردہ رہنمائی تھی جس نے بصری اور صوتی غیر معمولی حالتوں کو ایک ساتھ اجاگر کیا۔

یہ اعداد و شمار ظاہر کرتے ہیں کہ سینسر اسٹریمز کو لسانی پروسیسنگ کے ساتھ ملانے سے سافٹ روبوٹکس کی دیکھ بھال کو ردِعمل کے بجائے پیشگی (predictive) عمل میں بدلا جا سکتا ہے۔

ممکنہ نقصانات

یہ طریقہ کار ایک ہی بڑے ماڈل کی سادگی کے بدلے ٹیچرز اور ایک الائنمنٹ لیئر کے پیچیدہ انتظام کو اپناتا ہے۔ کئی ماہر ماڈلز کو برقرار رکھنے کے لیے ہر موڈالٹی کے لیے زیادہ ٹریننگ ڈیٹا اور ورژن کنٹرول کی ضرورت ہوتی ہے۔

آگے کیا ہے

خلاصہ: ایک ہلکے پھلکے کثیر لسانی ماڈل کو بصری، صوتی اور ٹیکسٹ کو ایک ساتھ سمجھنے کی تربیت دینے سے انجینئرز دیکھ بھال کے دورانیے کو کم کر سکتے ہیں اور سافٹ روبوٹکس کی بھروسہ مندی کو متنوع افرادی قوت کی پہنچ میں لا سکتے ہیں۔ یہ طریقہ ثابت کرتا ہے کہ بڑا نہیں بلکہ زیادہ ذہین AI، زبان کے فرق اور سینسروں کی علیحدگی کو ریئل ٹائم میں ختم کر سکتا ہے۔