فی-فی لی و یونژو لی در پادکست اخیر a16z بیان کردند که World Labs در حال ارائه یک خط لوله «واقعیت-به-شبیه‌سازی-به-واقعیت» (real-to-sim-to-real) است که به ربات‌ها اجازه می‌دهد وظایف مکانی را در دوقلوهای دیجیتال با دقت بالا یاد بگیرند، پیش از آنکه حتی با یک کف فیزیکی تماس پیدا کنند. این رویکرد هزینه و ریسک جمع‌آوری داده‌های آموزشی ربات را کاهش می‌دهد؛ مانعی که بسیاری از پروژه‌های اتوماسیون را در مرحله آزمایشگاهی متوقف نگه داشته است.

چرا ربات‌ها به چیزی فراتر از زبان نیاز دارند

مدل‌های زبانی بزرگ می‌توانند کل اینترنت را برای استخراج متن جستجو کنند، اما یک ربات نمی‌تواند صرفاً با تماشای ویدئوها، آنچه را می‌بیند کپی کند. برای حرکت در یک انبار یا تمیز کردن یک اتاق هتل، یک ربات باید هندسه سه‌بعدی، ویژگی‌های سطحی و فیزیکِ هل دادن، بلند کردن و چیدن را درک کند. این‌ها اجزای تشکیل‌دهنده «هوش مکانی» هستند و ثبت آن‌ها در مقیاس بزرگ در دنیای واقعی دشوار است.

گلوگاه داده

جمع‌آوری داده‌های رباتیک در دنیای واقعی کند، گران و گاهی خطرناک است. یک حادثه کوچک می‌تواند به سخت‌افزار آسیب برساند، خط تولید را متوقف کند یا حتی به یک کارگر انسانی آسیب بزند. به همین دلیل، اکثر تیم‌های رباتیک به مجموعه‌داده‌های کوچک و دست‌ساز متکی هستند که تنوع محیط‌های روزمره را پوشش نمی‌دهند.

World Labs با ساخت دنیای‌های دیجیتال هم‌سو، از این گلوگاه عبور می‌کند. سیستم SceniX آن‌ها یک فضای فیزیکی را به یک شبیه‌سازی تبدیل می‌کند که هندسه (شکل دیوارها و اشیاء)، ظاهر (بافت‌ها، رنگ‌ها، نورپردازی) و فیزیک (نحوه حرکت اشیاء هنگام هل داده شدن) را حفظ می‌کند. ربات در آن نسخه مجازی تمرین می‌کند و سپس همان سیاست‌ها (policies) به محیط واقعی منتقل می‌شوند.

مدل‌های ویدئویی کافی نیستند

برخی از پژوهشگران استدلال می‌کنند که مولدهای ویدئویی با وضوح بالا می‌توانند جایگزین شبیه‌سازی فیزیکی شوند. این مدل‌ها می‌توانند فریم‌های باورپذیری از دیدگاه ربات تولید کنند، اما فاقد فیزیک منسجم هستند. اگر یک ویدئوی شبیه‌سازی شده نشان دهد که یک فنجان پس از هل داده شدن ناپدید می‌شود، رباتی که با آن تصاویر آموزش دیده است، رابطه علت و معلولی اشتباهی را یاد می‌گیرد. خط لوله World Labs بر دنیایی‌ها اصرار دارد که در طول زمان، فضا و تعامل، منسجم باقی بمانند و اطمینان حاصل کنند که «حافظه عضلانی» ربات با فیزیک دنیای واقعی مطابقت دارد.

هدف‌گذاری بر فضاهای نیمه‌ساختاریافته

این تیم به دنبال دستیارهای انسان‌نمایی نیست که فردا در اتاق نشیمن قدم بزنند. در عوض، آن‌ها بر محیط‌های نیمه‌ساختاریافته تمرکز می‌کنند که چیدمان آن‌ها به اندازه کافی قابل پیش‌بینی است تا یک دوقلوی دیجیتال دقیق باشد، اما در عین حال به اندازه کافی متنوع است که نیاز به استدلال مکانی واقعی داشته باشد. نمونه‌ها عبارتند از:

  • انبارها، جایی که کالاها روی قفسه‌ها و پالت‌ها ذخیره می‌شوند
  • رستوران‌ها با میزها، صندلی‌ها و کارکنان در حال حرکت
  • هتل‌ها با راهروها، اتاق‌ها و چرخ‌دستی‌های خدمات
  • سایت‌های صنعتی با ماشین‌آلات، تسمه‌نوارها و موانع ایمنی

این‌ها مکان‌هایی هستند که کسب‌وکارها در حال حاضر تقاضای اتوماسیون در آن‌ها را دارند. یک نظرسنجی اخیر که در این پادکست به آن اشاره شد، نشان داد که یک‌سوم وظایف درخواستی ربات‌ها شامل نظافت است؛ کارهای تکراری و ناخوشایندی که انسان‌ها مشتاقند آن‌ها را به ماشین‌ها بسپارند.

معیار موفقیت

نقشه راه World Labs بر اثبات این خط لوله در صنایع خاص طی دو سال آینده استوار است. اگر یک ربات بتواند به طور مکرر یک پالت را در یک انبار شبیه‌سازی شده جابه‌جا کند و سپس همان کار را در یک تأسیسات واقعی بدون نیاز به آموزش مجدد انجام دهد، مدل ثابت کرده است که «شبیه‌سازی قابل اعتماد منجر به ربات‌های قابل اعتماد می‌شود». این قابلیت اطمینان می‌تواند قراردادهای بزرگتری را باز کند و سرمایه‌گذاری اولیه در ایجاد دوقلوهای دیجیتال را توجیه کند.

آنچه باید در آینده زیر نظر داشت

  • پروژه‌های آزمایشی صنعتی – اولین موارد استقرار در انبارها یا هتل‌ها مشخص خواهد کرد که آیا این خط لوله می‌تواند از پس موارد پیچیده و استثنایی (edge cases) که فقط در محیط کار واقعی ظاهر می‌شوند، برآید یا خیر.

ایده اصلی ساده است: قبل از اینکه ربات‌ها وارد صحنه شوند، به آن‌ها یک فضای تمرین بی‌نقص بدهید. اگر World Labs بتواند آن تمرین را به یک اجرای منسجم تبدیل کند، سخت‌ترین مسئله در رباتیک — یعنی آموزش ماشین‌ها برای درک و عمل در دنیای فیزیکی — ممکن است بالاخره یک راه حل عملی پیدا کند.