نویسندگان مقاله SEED روشی را معرفی کردند که به عامل‌های یادگیری تقویتی (RL) اجازه می‌دهد گزارش‌های شکست خود را به داده‌های آموزشی جدید تبدیل کنند. این روش میانگین امتیازات در بنچمارک ALFWorld را به ۹۱.۸ می‌رساند و حجم داده‌های آموزشی را تقریباً ۴۰٪ کاهش می‌دهد. همین تکنیک باعث افزایش ۱۵.۳ امتیازی در وظایفی می‌شود که عامل‌ها هرگز ندیده‌اند، که ثابت می‌کند یک مدل می‌تواند بدون نظارت اضافیِ نوشته‌شده توسط انسان، از اشتباهات خود درس بگیرد.

چرا عامل‌های RL به چیزی فراتر از یک پرچم موفقیت/شکست نیاز دارند

تنظیمات معمول RL تنها در پایان یک اپیزود طولانی به عامل پاداش می‌دهند. این سیگنال به سیستم می‌گوید که نتیجه اشتباه بوده است، اما چیزی درباره اینکه خطا در کجا رخ داده نمی‌گوید. اگر اشتباهی ده مرحله قبل‌تر اتفاق افتاده باشد — مثلاً یک عبارت جستجوی اشتباه وارد شده یا یک فایل نادرست باز شده باشد — سیگنال باینری نهایی تمام اطلاعات میانی را دور می‌ریزد. این فقدان، پژوهشگران را مجبور می‌کند تا تعداد بسیار زیادی اپیزود را جمع‌آوری کنند تا تنها بتوانند الگوهای نادری را که منجر به شکست می‌شوند، استخراج کنند.

SEED چگونه حلقه بازخورد را تغییر می‌دهد

روش SEED (Self-Evolving On-Policy Distillation) پس از هر اپیزود، یک مرحله یادگیری دوم اضافه می‌کند:

  1. اتمام وظیفه – عامل تا پایان اجرا می‌شود و برچسب معمول موفقیت/شکست را دریافت می‌کند.
  2. خواندن متن خود – توالی اقدامات، مشاهدات و تصمیمات میانی به مدل بازگردانده می‌شود.
  3. نوشتن درس‌های زبان طبیعی – مدل جملات کوتاهی تولید می‌کند که توضیح می‌دهند چه چیزی اشتباه بوده است، مثلاً: «عبارت جستجوی 'X' نتایج نامرتبط بازگرداند» یا «به جای 'Z'، فایل 'Y' باز شد».
  4. تقطیر درس‌ها در به‌روزرسانی‌های سیاست (policy updates) – آن جملات به هدفی برای یک مرحله جدید تقطیر درون-سیاستی (on-policy distillation) تبدیل می‌شوند و منطق پشت اصلاح را به مدل می‌آموزند.

درس‌های تولید شده، پرامپت‌هایی نیستند که در زمان استنتاج (inference time) استفاده شوند؛ بلکه سیگنال‌های آموزشی داخلی هستند که سیاست (policy) را بازسازی می‌کنند. در واقع، عامل به معلم خود تبدیل می‌شود و گزارش‌های خام شکست را به دانش ساختاریافته تبدیل می‌کند.

چه چیزی این رویکرد را از ترفندهای حافظه‌ای کارآمدتر می‌کند

یک راه حل رایج، اتصال یک بافر حافظه خارجی است که حالت‌های قابل توجه یا یادداشت‌ها را برای بازیابی بعدی ذخیره می‌کند. این استراتژی یک «کمد بایگانی» گسترده ایجاد می‌کند که در آن عامل باید یاد بگیرد قطعه درست را در لحظه درست بازیابی کند؛ مسئله‌ای غیربدیهی که بار اضافی ایجاد می‌کند و همچنان می‌تواند پیوند علی بین عمل و نتیجه را از دست بدهد.

SEED از مشکل بازیابی عبور می‌کند. با گنجاندن مستقیم درس در سیاست از طریق تقطیر، عامل اصلاح را به جای یک یادداشت برای جستجو در آینده، به عنوان یک مهارت درونی می‌کند. نتیجه، یک حلقه تنگ‌تر بین تشخیص خطا و تغییر رفتار است.

اعداد مهم

  • بنچمارک ALFWorld – میانگین امتیاز ۹۱.۸، که از خطوط پایه (baselines) معمول RL که از همان محیط استفاده می‌کنند، پیشی می‌گیرد.
  • کارایی داده – دستیابی به عملکرد مشابه یا بهتر با حدود ۴۰٪ اپیزود آموزشی کمتر.
  • تعمیم‌پذیری – در وظایف دیده نشده، این روش ۱۵.۳ امتیاز نسبت به RL استاندارد اضافه می‌کند، که نشان می‌دهد درس‌های خود-تولید شده، الگوهای استدلالی قابل انتقال را در بر می‌گیرند.

این ارقام نشان می‌دهند که SEED می‌تواند بودجه محاسباتی و داده‌ای برای آموزش عامل‌های پیچیده را کاهش دهد، که این یک مزیت بزرگ برای تیم‌هایی است که منابع شبیه‌سازی گسترده‌ای ندارند.

ریسک‌ها و محدودیت‌ها

این تکنیک به توانایی مدل در تفسیر صحیح تجربه خود بستگی دارد. اگر عامل محیط را اشتباه بخواند — مثلاً یک شکست را به علت اشتباه نسبت دهد — ممکن است یک درس کاملاً غلط اما با اعتمادبه‌نفس بالا تولید کند. آموزش بر اساس چنین توصیه‌های توهم‌آمیزی (hallucinated) می‌تواند عادت‌های بد را تقویت کند. نویسندگان خاطرنشان می‌کنند که این موضوع مشابه تحلیل‌های پس از حادثه (post-mortems) در انسان است، جایی که تحلیلگران گاهی توضیحات بیش از حد مرتبی می‌سازند که مسائل عمیق‌تر را پنهان می‌کند.

چه چیزی را در آینده باید زیر نظر داشت

  • ادغام با خط لوله‌های (pipelines) موجود RL – از آنجایی که SEED تنها یک مرحله پردازش پس از اپیزود اضافه می‌کند، می‌تواند با تلاش مهندسی اندک در بسیاری از حلقه‌های آموزشی موجود قرار گیرد.

توسعه‌دهندگانی که عامل‌های RL می‌سازند، باید شروع کنند به اینکه با گزارش‌های اپیزود فراتر از داده‌های آرشیوی برخورد کنند. پس از هر اجرا، از سیستم بخواهید موارد زیر را برجسته کند:

  • تصمیمی که بیشترین پیشرفت را در وظیفه ایجاد کرد.
  • فرضی که باعث بیشترین اتلاف مراحل شد.
  • یک بررسی ساده که می‌توانست خطا را زودتر شناسایی کند.

به جای اینکه آن یادداشت‌ها را به عنوان پرامپت‌های موردی (ad-hoc) بازگردانید، آن‌ها را در یک مرحله تقطیر مانند آنچه SEED پیشنهاد می‌دهد، وارد کنید. نتیجه مشخص است: عملکرد بهتر، داده کمتر و مدلی که یاد می‌گیرد اشتباهات خود را توضیح دهد.

نکته کلیدی: تبدیل گزارش‌های شکست به درس‌های خود-تولیدشده می‌تواند بازخورد پاداش پراکنده را به یک سیگنال آموزشی غنی و قابل استفاده مجدد تبدیل کند و مسیری عملی برای دستیابی به RL سریع‌تر و با بهره‌وری داده‌ای بیشتر فراهم آورد.