یک چارچوب تقطیر دانش میان‌حسی (cross-modal knowledge-distillation)، زمان نگهداری و تعمیرات رباتیک نرم را برای تیم‌های چندزبانه ۳۴٪ کاهش داد، موتور استنتاج را ۶۰٪ کوچک‌تر کرد و دستورالعمل‌ها را در کمتر از ۴۵ میلی‌ثانیه ارائه داد. این پیشرفت از آن جهت اهمیت دارد که ربات‌های نرم — که از پلیمرهای انعطاف‌پذیر و عملگرهای سیالاتی ساخته شده‌اند — در حال گسترش در بخش‌های تولید، تجهیزات پزشکی و سایت‌های خطرناک هستند، اما موانع زبانی و جریان‌های پراکنده داده‌های حسگر، مانع از نگهداری صحیح آن‌ها می‌شود.

چرا نگهداری و تعمیرات رباتیک نرم یک مسئله چندوجهی است

ربات‌های نرم با بازوهای فلزی متفاوت هستند: الاستومرها، پوست‌های سیلیکونی و کانال‌های تعبیه‌شده، مایعات را پمپ می‌کنند. ترک در یک غشا، نشتی در یک خط پنوماتیک یا تغییر جزئی در صدای ناله‌ی پمپ، همگی می‌توانند نشانه‌ای از خرابی قریب‌الوقوع باشند. تشخیص این نشانه‌ها به بیش از یک منبع داده نیاز دارد.

  • دیداری (Visual): فیدهای تصویری تغییر شکل‌های سطحی یا تغییر رنگ را نشان می‌دهند.
  • لامسه‌ای (Tactile): حسگرها میزان انطباق‌پذیری یا لغزش غیرمنتظره را گزارش می‌دهند.
  • صوتی (Acoustic): میکروفون‌ها فرکانس‌های غیرعادی پمپ را ثبت می‌کنند.
  • زبانی (Linguistic): ورودی‌های متنی، دستورالعمل‌های تعمیر را به زبان مادری تکنسین منتقل می‌کنند.

زمانی که یک اپراتور اسپانیایی‌زبان از دستورالعمل‌های صرفاً انگلیسیِ یک مدل ترجمه استاندارد پیروی کرد، مدل متن را به‌درستی بازگرداند اما نشانه بصری یک ترک در حال گسترش را نادیده گرفت. فرآیند تعمیر با تأخیر مواجه شد و توقف خط تولید هزینه‌بر بود. این حادثه سه چالش درهم‌تنیده را آشکار کرد: عدم تطابق وجه‌ها (modalities)، اصطلاحات فنی که در برابر ترجمه تحت‌اللفظی مقاومت می‌کنند، و نیاز به بازخورد بی‌درنگ در محل کار.

روش کار تقطیر دانش میان‌حسی

محققان یک هوش مصنوعی یکپارچه (monolithic) را با مجموعه‌ای از مدل‌های «معلم» (teacher) جایگزین کردند که هر کدام در یک وجه تخصص دارند، و یک مدل «دانشجو» (student) سبک‌وزن که بینش‌های آن‌ها را با هم ترکیب می‌کند. این خط لوله (pipeline) دارای سه مرحله است:

  1. معلمان مختص هر وجه – شبکه‌های عصبی مجزایی که بر روی مجموعه‌داده‌های تصویری، صوتی و متنی آموزش دیده‌اند. معلم تصویری ترک‌ها را شناسایی می‌کند، معلم صوتی صداهای غیرعادی پمپ را علامت‌گذاری می‌کند و معلم زبانی دفترچه‌های راهنمای فنی را تجزیه و تحلیل می‌کند.
  2. ماژول هم‌ترازی (Alignment module) – یک پل عصبی که خروجی‌های ناهمگون را به یک فضای جاسازی (embedding space) مشترک منتقل می‌کند. یادگیری تقابلی (Contrastive learning) سیستم را مجبور می‌کند تا برای مثال، یک ترک بصری را با امضای صوتی آن مرتبط کند، به‌طوری که جاسازی‌ها (embeddings) معنای میان‌حسی را در بر بگیرند.
  3. دانشجوی چندزبانه – یک مدل فشرده که جاسازی‌های هم‌تراز شده را دریافت کرده و دستورالعمل‌های تعمیر را به هر زبان پشتیبانی‌شده تولید می‌کند. یک گراف دانش تخصصی، ترجمه‌های صحیح را برای اصطلاحات تخصصی مانند “pneumatic diaphragm” یا “hydrogel actuator” فراهم می‌کند.

کوانتیزاسیون (Quantization) — یعنی کاهش دقت وزن‌ها — حجم مدل دانشجو را ۶۰٪ کاهش می‌دهد و اجازه می‌دهد روی دستگاه‌های لبه (edge devices) با بودجه محاسباتی پایین اجرا شود. تأخیر استنتاج حاصل که ۴۵ میلی‌ثانیه است، نیازهای بی‌درنگ اپراتوری را که همزمان با تماشای فید زنده دوربین، به صدای پمپ گوش می‌دهد، برآورده می‌کند.

بهبود عملکرد و تأثیرات دنیای واقعی

این چارچوب در یک مرکز همکار مورد آزمایش قرار گرفت.

  • صرفه‌جویی در زمان: تیم‌های چندزبانه به لطف راهنمایی‌های فوری و متناسب با زبان که ناهنجاری‌های بصری و صوتی را به‌طور همزمان برجسته می‌کرد، بررسی‌های روتین را ۳۴٪ سریع‌تر انجام دادند.

این اعداد نشان می‌دهند که ادغام جریان‌های حسگر با پردازش زبان می‌تواند نگهداری و تعمیرات رباتیک نرم را از حالت واکنشی (reactive) به حالت پیش‌بینانه (predictive) تغییر دهد.

معایب احتمالی

این رویکرد، سادگیِ یک مدل عظیم واحد را با مدیریت پیچیده‌تر مجموعه‌ای از معلمان و یک لایه هم‌ترازی معاوضه می‌کند. نگهداری چندین مدل متخصص، مستلزم داده‌های آموزشی بیشتر برای هر وجه و کنترل نسخه (version control) دقیق است.

گام‌های بعدی

نتیجه‌گیری: آموزش یک مدل چندزبانه و سبک برای شنیدن همزمان تصویر، صدا و متن، به مهندسان اجازه می‌دهد چرخه‌های نگهداری را کاهش داده و قابلیت اطمینان رباتیک نرم را در دسترس نیروی کار متنوع قرار دهند. این روش ثابت می‌کند که هوش مصنوعیِ هوشمندتر (و نه لزوماً بزرگ‌تر)، می‌تواند شکاف‌های زبانی و جزیره‌ای بودن داده‌های حسگر را در لحظه برطرف کند.