LongStraw اعلام کرد که تکنیک branch-replay آن می‌تواند ۲.۱ میلیون جایگاه توکن را برای پس‌آموزش یادگیری تقویتی (RL) تنها با استفاده از هشت پردازنده گرافیکی H20 پردازش کند و هزینه‌های سخت‌افزاری را تا یک مرتبه بزرگی کاهش دهد. این ادعا از آن جهت حائز اهمیت است که آموزش مدل‌های با بافت (context) طولانی به‌طور سنتی به ده‌ها پردازنده گرافیکی رده‌بالا نیاز داشت که این موضوع مانعی برای اکثر آزمایشگاه‌های تحقیقاتی و استارتاپ‌ها محسوب می‌شد.

چرا RL با بافت طولانی گران است

تنظیم دقیق (fine-tuning) مدل‌های زبانی بزرگ مبتنی بر RL معمولاً شامل اجرای رول‌اوت‌هایی (rollouts) است که تکمیل‌های جایگزین بسیاری را برای یک پرامپت مشابه تولید می‌کنند. هر رول‌اوت باید پس‌انتشار (back-propagated) شود، بنابراین هزینه محاسباتی با تعداد کل جایگاه‌های توکن پردازش‌شده متناسب است. خط‌لوله‌های (pipelines) فعلی که با هدف بافت یک میلیون توکنی کار می‌کنند، اغلب برای اتمام کار در یک بازه زمانی معقول به ۶۴ تا ۱۲۸ پردازنده گرافیکی نیاز دارند. هزینه این سخت‌افزار، به علاوه برق و سیستم خنک‌کننده‌ای که مصرف می‌کند، میزان پیشروی متخصصان در افزایش طول بافت را محدود می‌کند.

چگونه branch-replay حجم کاری را کاهش می‌دهد

رویکرد LongStraw بر دو مشاهده در مورد تولید (generation) در ترنسفورمرها استوار است:

  • پرامپت و بخش اولیه یک پاسخ در تمام رول‌اوت‌ها یکسان هستند.
  • تنها بخش انتهایی متفاوت (divergent tail) هر پاسخ واقعاً به محاسبات جدید نیاز دارد.

این سیستم یک پشته اجرای آگاه از معماری (architecture-aware execution stack) می‌سازد که فعال‌سازی‌ها (activations) را برای پیشوند مشترک ثبت می‌کند. هنگامی که یک شاخه جدید بررسی می‌شود، سیستم به جای محاسبه مجدد، پیشوند ذخیره‌شده (cached) را بازپخش می‌کند و سپس گذر پس‌رو (backward pass) را تنها روی بخش جدید اجرا می‌کند. در عمل، این بدان معناست که گذر پس‌رو با جایگاه‌های توکن بسیار کمتری درگیر می‌شود و کاهش ۸ تا ۱۶ برابری در محاسبات خام را به ارمغان می‌آورد.

تأثیرات فوری

  • پردازش ۲.۱ میلیون جایگاه توکن روی هشت پردازنده گرافیکی H20؛ بودجه سخت‌افزاری که در حالت عادی تنها از بخش کوچکی از این حجم کاری پشتیبانی می‌کرد.
  • هدف قرار دادن مستقیم گلوگاه در RL با بافت طولانی، جایی که با افزایش بافت، هزینه‌های حافظه و محاسبات به شدت افزایش می‌یابد.
  • آزمایشگاه‌ها می‌توانند تخصیص GPU خود را تغییر دهند: همان سخت‌افزار که عمدتاً یک شتاب‌دهنده استنتاج (inference accelerator) است، اکنون می‌تواند برای آموزش استفاده شود، اگرچه ممکن است نتایج در کارت‌های دیگر متفاوت باشد.

پرسش‌های بی‌پاسخ و محدودیت‌ها

این اعلامیه ارقام مربوط به سرعت آموزش و منحنی‌های همگرایی را ذکر نکرده است، بنابراین نمی‌دانیم که آیا کاهش محاسبات به کاهش زمان واقعی (wall-clock time) منجر می‌شود یا صرفاً میزان اشغال GPU (occupancy) را پایین می‌آورد. این روش برای نمونه‌برداری خودبازگشتی (autoregressive sampling) توصیف شده است؛ رفتار آن در استراتژی‌های غیرخودبازگشتی یا ترکیبی هنوز آزمایش نشده است. از آنجایی که H20 عمدتاً یک شتاب‌دهنده استنتاج است، عملکرد آن روی کارت‌های آموزشی رایج‌تر مانند H100 یا B200 می‌تواند متفاوت باشد.

بنچمارک‌های مستقل هنوز اعداد LongStraw را تأیید نکرده‌اند. بدون تأیید شخص ثالث، جامعه علمی باید این نتایج را امیدوارکننده اما موقتی در نظر بگیرد.

آنچه در میان است

اگر ایده branch-replay به سایر الگوریتم‌های تنظیم دقیق RL مانند بهینه‌سازی ترجیح مستقیم (DPO) یا بهینه‌سازی سیاست نزدیک (PPO) تعمیم یابد، مانع هزینه‌ای برای مدل‌های با بافت طولانی می‌تواند از بین برود.

آنچه باید زیر نظر داشت

  • تلاش‌های شخص ثالث برای بازتولید (replication) نتایج روی طیف وسیعی از معماری‌های GPU.
  • به‌روزرسانی‌های LongStraw در مورد توان عملیاتی (throughput) آموزش و کیفیت نهایی مدل در مقایسه با خط‌لوله‌های پایه (baseline pipelines).