روش جدید ABSeeker تحت عنوان «تخصیص اعتبار با بازگشت به پاسخ» (Answer-Backtracked Credit Assignment یا به اختصار ABC)، به عاملهای جستجوی با افق طولانی اجازه میدهد تا به جای دریافت اعتبار تنها برای پاسخ نهایی، برای هر مرحلهی انفرادی نیز اعتبار کسب کنند؛ و یک مدل ۴ میلیارد پارامتری که با این روش آموزش دیده است، هماکنون میتواند با رقبای بسیار بزرگتر برابری کرده یا حتی از آنها پیشی بگیرد.
این پیشرفت از این جهت اهمیت دارد که اکثر عاملهای موجود تنها در پایان یک وظیفه مورد قضاوت قرار میگیرند. اگر پاسخ نهایی درست باشد، کل فرآیند خوب تلقی میشود؛ و اگر غلط باشد، کل توالی بد علامتگذاری میشود. این بازخوردِ «همه یا هیچ»، سیگنال یادگیری واقعی را پنهان میکند؛ یعنی حرکتهای خوبی که از قضا با یک اشتباه دنبال شدهاند، یا کلیکهای بیفایدهای که از خوششانسی به نتیجه درست منجر شدهاند. رویکرد ABSeeker این قانون را بازنویسی میکند.
چرا رویکرد قدیمی ناکافی است
وقتی یک عامل جستجو میکند، کد مینویسد یا شواهدی را جمعآوری میکند، معمولاً اقدامات متعددی انجام میدهد: ارسال پرسوجوها، باز کردن صفحات، اجرای دستورات، بررسی وضعیت سیستم و غیره. در یک اجرای پانزده مرحلهای، یک قدم اشتباه میتواند پاسخ نهایی را نابود کند، حتی اگر مراحل قبلی درست بوده باشند. برعکس، فرآیندی که با پاسخ درست پایان مییابد، ممکن است بر شانس و اقبال تکیه کرده باشد، در حالی که اکثر مراحل هیچ ارزش افزودهای نداشتهاند. آموزش تنها بر اساس نتیجه نهایی، مدل را مجبور میکند تا کل مسیر را به عنوان یک «جعبه سیاه» واحد در نظر بگیرد و این امر یادگیری اینکه کدام زیر-رفتارها واقعاً مفید هستند را دشوار میکند.
این وضعیت مشابه عیبیابی (debugging) در مهندسی نرمافزار است. توسعهدهندگان هر خط را ردیابی میکنند، فراخوانیِ خطا را ایزوله کرده و آن را اصلاح میکنند. با این حال، به عاملها هیچ «رسید» مشابهی از کارکرد داخلیشان داده نشده است. بدون این ردپای بازرسی (audit trail)، توسعهدهندگان نمیتوانند تشخیص دهند که آیا یک بهبود ناشی از استدلال بهتر است یا صرفاً از روی شانس، و نمیتوانند بهطور سیستماتیک عادتهای بد را اصلاح کنند.
چگونه ABC تخصیص اعتبار را بازطراحی میکند
روش «تخصیص اعتبار با بازگشت به پاسخ» از پاسخ نهایی صحیح به عقب حرکت میکند. این روش ابتدا سرنخهای ضروری را که پاسخ به آنها وابسته است استخراج میکند؛ یعنی قطعات خاصی از شواهد، نتایج میانی یا بررسیهای وضعیت. سپس از طریق ردپای ثبتشده به عقب بازمیگردد و هر اقدام را در برابر آن سرنخها امتیازدهی میکند. اقدامی که مستقیماً به یک سرنخ مورد نیاز کمک کرده باشد، اعتبار مثبت دریافت میکند؛ و یک اقدام بیربط یا مضر، امتیاز منفی یا صفر میگیرد.
دو رژیم آموزشی بر پایه این امتیازدهی بنا شدهاند:
- ABC-SFT (تنظیم دقیق نظارتشده): تابع زیان (loss function) را بهگونهای بازوزندهی میکند که مراحلی با اعتبار بالاتر، تأثیر قویتری بر مدل داشته باشند. مدل یاد میگیرد اولویت را به اقداماتی بدهد که از نظر تاریخی منجر به سرنخهای مفید شدهاند.
- ABC-GRPO (بهینهسازی سیاست پاداش مبتنی بر گرادیان): امتیازات هر مرحله را به عنوان یک سیگنال پاداش برای یادگیری تقویتی در نظر میگیرد و بخشهای خاصی از جستجو را که به ظهور پاسخ کمک کردهاند، تقویت میکند.
با تبدیل یک برچسب باینریِ «قبولی/رد» به یک نقشه دقیق از میزان مشارکت، ABC سیگنال یادگیری بسیار غنیتری به مدل ارائه میدهد.
نتایج اولیه گویای همه چیز هستند
محققان ABC را روی یک مدل متوسط ۴ میلیارد پارامتری که مجهز به یک لایه مدیریت کانتکست (context-management) برای ردیابی وضعیت در حال تغییر جستجو بود، اعمال کردند. در وظایف معیار (benchmark) که بهطور سنتی عاملهای بسیار بزرگتر را در اولویت قرار میدهند، مدل آموزشدیده با ABC یا با آن سیستمهای بزرگتر برابری کرد و یا از آنها بهتر عمل نمود. این بهبود عملکرد بدون افزایش اندازه مدل حاصل شد، که نشان میدهد تخصیص اعتبار بهتر میتواند جایگزین تعداد پارامترهای خام شود.
نتیجه کلیدی ساده است: به مدل یک رسید شفاف از آنچه کارآمد بوده بدهید، تا بتواند ارزش بیشتری از همان مقدار دادههای آموزشی استخراج کند.
این موضوع برای عاملهای دنیای واقعی چه معنایی دارد
هر عاملی که کارهای چندمرحلهای انجام میدهد — از دستیارهای کدنویسی و رباتهای مرور ادبیات گرفته تا ابزارهای پشتیبانی مشتری — به ردپایی از اقدامات خود متکی است. ABC نشان میدهد که حفظ و ارزیابی آن ردپا، یک ویژگی جانبی و اختیاری نیست؛ بلکه برای یادگیری مؤثر، ضروری است.
- عاملهای کدنویسی باید برنامه، هر دستور صادر شده و نتایج تستهایی که کد را تأیید میکنند، ثبت کنند.
- عاملهای پژوهشی باید پرسوجوهایی که ارسال کردهاند، منابعی که باز کردهاند و شواهدی که استخراج کردهاند را حفظ کنند.
- عاملهای پشتیبانی باید هر بررسی وضعیت و نقطه تصمیمی را که منجر به حل مسئله شده است، ضبط کنند.
وقتی این ردپاها در دسترس باشند، ABC میتواند اعتبار را با دقت تخصیص دهد و به مدل اجازه دهد تا عادتهای خوب را تقویت کرده و میانبرهای شانسی را که در غیر این صورت با مهارت اشتباه گرفته میشوند، کنار بگذارد.
نکات متقابل و موانع عملی
مزایای ABC با پیچیدگیهای اضافهای همراه است.
خلاصه کلام
Answer-Backtracked Credit Assignment قواعد بازی را در نحوه آموزش عاملها برای جستجو، کدنویسی و استدلال تغییر میدهد. این روش با پاداش دادن به گامهای درست در طول مسیر، بهجای تمرکز صرف بر مقصد نهایی، به مدلهایی با ابعاد متوسط اجازه میدهد تا به همان اندازه مؤثر مدلهای بسیار بزرگتر یاد بگیرند. برای هر کسی که در حال ساخت عاملهایی برای انجام وظایف چندمرحلهای است، اتخاذ یک رژیم آموزشی مبتنی بر ردپا (trace-centric) یک انتخاب نیست، بلکه راهی است به سوی هوش مصنوعی قابل اعتماد، قابل بازرسی و در نهایت هوشمندتر.
