LongStraw اعلام کرد که تکنیک branch-replay آن میتواند ۲.۱ میلیون جایگاه توکن را برای پسآموزش یادگیری تقویتی (RL) تنها با استفاده از هشت پردازنده گرافیکی H20 پردازش کند و هزینههای سختافزاری را تا یک مرتبه بزرگی کاهش دهد. این ادعا از آن جهت حائز اهمیت است که آموزش مدلهای با بافت (context) طولانی بهطور سنتی به دهها پردازنده گرافیکی ردهبالا نیاز داشت که این موضوع مانعی برای اکثر آزمایشگاههای تحقیقاتی و استارتاپها محسوب میشد.
چرا RL با بافت طولانی گران است
تنظیم دقیق (fine-tuning) مدلهای زبانی بزرگ مبتنی بر RL معمولاً شامل اجرای رولاوتهایی (rollouts) است که تکمیلهای جایگزین بسیاری را برای یک پرامپت مشابه تولید میکنند. هر رولاوت باید پسانتشار (back-propagated) شود، بنابراین هزینه محاسباتی با تعداد کل جایگاههای توکن پردازششده متناسب است. خطلولههای (pipelines) فعلی که با هدف بافت یک میلیون توکنی کار میکنند، اغلب برای اتمام کار در یک بازه زمانی معقول به ۶۴ تا ۱۲۸ پردازنده گرافیکی نیاز دارند. هزینه این سختافزار، به علاوه برق و سیستم خنککنندهای که مصرف میکند، میزان پیشروی متخصصان در افزایش طول بافت را محدود میکند.
چگونه branch-replay حجم کاری را کاهش میدهد
رویکرد LongStraw بر دو مشاهده در مورد تولید (generation) در ترنسفورمرها استوار است:
- پرامپت و بخش اولیه یک پاسخ در تمام رولاوتها یکسان هستند.
- تنها بخش انتهایی متفاوت (divergent tail) هر پاسخ واقعاً به محاسبات جدید نیاز دارد.
این سیستم یک پشته اجرای آگاه از معماری (architecture-aware execution stack) میسازد که فعالسازیها (activations) را برای پیشوند مشترک ثبت میکند. هنگامی که یک شاخه جدید بررسی میشود، سیستم به جای محاسبه مجدد، پیشوند ذخیرهشده (cached) را بازپخش میکند و سپس گذر پسرو (backward pass) را تنها روی بخش جدید اجرا میکند. در عمل، این بدان معناست که گذر پسرو با جایگاههای توکن بسیار کمتری درگیر میشود و کاهش ۸ تا ۱۶ برابری در محاسبات خام را به ارمغان میآورد.
تأثیرات فوری
- پردازش ۲.۱ میلیون جایگاه توکن روی هشت پردازنده گرافیکی H20؛ بودجه سختافزاری که در حالت عادی تنها از بخش کوچکی از این حجم کاری پشتیبانی میکرد.
- هدف قرار دادن مستقیم گلوگاه در RL با بافت طولانی، جایی که با افزایش بافت، هزینههای حافظه و محاسبات به شدت افزایش مییابد.
- آزمایشگاهها میتوانند تخصیص GPU خود را تغییر دهند: همان سختافزار که عمدتاً یک شتابدهنده استنتاج (inference accelerator) است، اکنون میتواند برای آموزش استفاده شود، اگرچه ممکن است نتایج در کارتهای دیگر متفاوت باشد.
پرسشهای بیپاسخ و محدودیتها
این اعلامیه ارقام مربوط به سرعت آموزش و منحنیهای همگرایی را ذکر نکرده است، بنابراین نمیدانیم که آیا کاهش محاسبات به کاهش زمان واقعی (wall-clock time) منجر میشود یا صرفاً میزان اشغال GPU (occupancy) را پایین میآورد. این روش برای نمونهبرداری خودبازگشتی (autoregressive sampling) توصیف شده است؛ رفتار آن در استراتژیهای غیرخودبازگشتی یا ترکیبی هنوز آزمایش نشده است. از آنجایی که H20 عمدتاً یک شتابدهنده استنتاج است، عملکرد آن روی کارتهای آموزشی رایجتر مانند H100 یا B200 میتواند متفاوت باشد.
بنچمارکهای مستقل هنوز اعداد LongStraw را تأیید نکردهاند. بدون تأیید شخص ثالث، جامعه علمی باید این نتایج را امیدوارکننده اما موقتی در نظر بگیرد.
آنچه در میان است
اگر ایده branch-replay به سایر الگوریتمهای تنظیم دقیق RL مانند بهینهسازی ترجیح مستقیم (DPO) یا بهینهسازی سیاست نزدیک (PPO) تعمیم یابد، مانع هزینهای برای مدلهای با بافت طولانی میتواند از بین برود.
آنچه باید زیر نظر داشت
- تلاشهای شخص ثالث برای بازتولید (replication) نتایج روی طیف وسیعی از معماریهای GPU.
- بهروزرسانیهای LongStraw در مورد توان عملیاتی (throughput) آموزش و کیفیت نهایی مدل در مقایسه با خطلولههای پایه (baseline pipelines).
