پژوهشگران از یک چارچوب جدید یادگیری تقویتی به نام Ring-Zero رونمایی کردند که به یک مدل زبانی با یک تریلیون پارامتر اجازه می‌دهد ضمن رعایت محدودیت‌های بودجه توکن، استدلال کردن را بیاموزد؛ این مدل در آزمون ریاضی AIME سال ۲۰۲۶ امتیاز ۸۴.۲٪ را کسب کرد. این نتیجه نشان می‌دهد که در این مقیاس، مدل می‌تواند عادت‌های حل مسئله گام‌به‌گام را که مهندسان به‌طور سنتی در پرامپت‌ها کدگذاری می‌کردند، به دست آورد.

چرا این موضوع اهمیت دارد

عملکرد در سطح AIME مدت‌هاست که معیاری برای استدلال کمی در «سطح انسانی» بوده است. رسیدن به محدوده ۸۴.۲٪ بدون استفاده از هیچ نمونه‌ی نوشته‌شده توسط انسان، نشان می‌دهد که توانایی‌های استدلالی مدل از خودِ دینامیک‌های آموزشی حاصل می‌شود، نه از داربست‌های دست‌ساز. برای شرکت‌هایی که در حال ساخت عامل‌های هوش مصنوعی (AI agents) هستند، پیام روشن است: نوشتن و نگهداری دستورالعمل‌های پیچیده پرامپت می‌تواند با یک حلقه آموزشی جایگزین شود که به مدل می‌آموزد چه زمانی عمیق‌تر فکر کند و چه زمانی یک میان‌بر ارزان کافی است.

از مهندسی پرامپت تا دینامیک‌های آموزشی

سال‌هاست که توسعه‌دهندگان برای ترغیب مدل‌های زبانی بزرگ به استدلال چندمرحله‌ای، به قالب‌های پرامپت مانند «مسئله را به بخش‌های مختلف تقسیم کن» یا «پاسخ خود را تأیید کن» متکی بوده‌اند. این قالب‌ها مانند یک داربست خارجی عمل می‌کنند؛ مدل دستورالعمل‌ها را دنبال می‌کند اما فرآیند را درونی نمی‌کند. Ring-Zero این پارادایم را تغییر می‌دهد. مدل یک شرح وظیفه را به همراه یک پاسخ قابل تأیید دریافت می‌کند—یک حقیقتِ پایه (ground-truth) که می‌تواند به‌طور خودکار بررسی شود. سپس مجموعه‌ای از تلاش‌ها را تولید می‌کند، تنها زمانی پاداش دریافت می‌کند که تلاش با پاسخ قابل تأیید مطابقت داشته باشد، و سیاست (policy) خود را از طریق یادگیری تقویتی به‌روزرسانی می‌کند.

از آنجایی که پاداش به هدفی گره خورده است که تقلب در آن دشوار است (پاسخ باید درست باشد، نه فقط باورپذیر)، مدل الگوهای استدلالی را به‌تنهایی کشف می‌کند. این مقاله استدلال می‌کند که وقتی یک سیگنال پاداش قابل اعتماد برقرار شود، مقیاس‌بندی مدل تا یک تریلیون پارامتر به‌طور خودکار همان ترفندهای مهندسی پرامپتی را آشکار می‌کند که مهندسان به‌صورت دستی برای مدل‌های کوچک‌تر وارد می‌کردند.

خط لوله آموزشی چهار مرحله‌ای

آموزش Ring-Zero از طریق چهار مرحله متمایز انجام می‌شود:

  1. مرحله اول RL – مدل ردپاهای استدلالی ممکن را جستجو می‌کند و می‌آموزد که کدام توالی‌های توکن تمایل دارند به پاسخ‌های صحیح منجر شوند.
  2. خود-تقطیر (Self-distillation) – ردپاهای باکیفیت به مدل بازمی‌گردند و الگوهای استدلالی نوظهور را تثبیت می‌کنند.
  3. مرحله دوم RL – یک حلقه دقیق‌تر، سیاست (policy) را در عین حفظ بهبودهای قبلی، اصلاح می‌کند.
  4. آموزش سلسله‌مراتبی (Tiered training) – مدل یاد می‌گیرد که بودجه توکن‌ها را به‌صورت هوشمند تخصیص دهد و بسته به دشواری مسئله، بین مسیرهای استدلالی کوتاه (≈۲ هزار توکن) و بلند (≈۲۰ هزار توکن) انتخاب کند.

آموزش سلسله‌مراتبی مرتبط‌ترین بخش با محیط عملیاتی است. در استقرار‌های واقعی، هر توکن اضافی هزینه محاسباتی را افزایش می‌دهد. Ring-Zero با آموزش مدل برای تشخیص اینکه چه زمانی یک مسئله به اندازه کافی ساده است که با پاسخ کوتاه حل شود و چه زمانی نیازمند تحلیل عمیق و چندمرحله‌ای است، کیفیت استدلال را مستقیماً به کارایی اقتصادی پیوند می‌زند.

دو مرحله یادگیری: کشف و صیقل‌دهی

نویسندگان منحنی یادگیری را به عنوان یک فرآیند دو مرحله‌ای توصیف می‌کنند:

  • کشف (Discovery) – مراحل اولیه یادگیری تقویتی نویز دارند؛ مدل استراتژی‌های بسیار متنوعی را امتحان می‌کند که بسیاری از آن‌ها شکست می‌خورند. این واریانس برای کشف مسیرهای استدلالی جدید ضروری است.
  • صیقل‌دهی (Sharpening) – زمانی که یک الگوی امیدوارکننده ظاهر می‌شود، مراحل بعدی RL سیاست را منسجم‌تر کرده، واریانس را کاهش داده و رفتار را تثبیت می‌کنند.

این روند مشابه نحوه پیشرفت انسان است: طوفان فکری اولیه و به دنبال آن تمرین متمرکز. نکته کلیدی این است که مرحله اولیه «آشفته» باید به جای سرکوب شدن، مورد استقبال قرار گیرد، زیرا مواد اولیه را برای اصلاحات بعدی فراهم می‌کند.

چه مشکلاتی ممکن است پیش بیاید؟

خوش‌بینی این مقاله به چند فرض بستگی دارد که نیاز به بررسی دقیق دارند:

  • طراحی پاداش – این چارچوب به پاداشی نیاز دارد که هم قابل تأیید باشد و هم در برابر میان‌بر زدن مقاوم باشد. برای بسیاری از وظایف دنیای واقعی، تعریف چنین پاداشی ساده نیست و ممکن است به خط لوله‌های برچسب‌گذاری (annotation) پرهزینه نیاز داشته باشد.
  • گلوگاه‌های محیطی – نویسندگان اشاره می‌کنند که عملکرد مدل نه با اندازه آن، بلکه با زیرساخت‌های ارزیابی اطراف آن (مجموعه تست‌ها، لاگ‌ها، معیارهای شفاف) محدود می‌شود. ساخت و نگهداری آن زیرساخت می‌تواند تلاش مهندسی قابل توجهی باشد.
  • هزینه محاسباتی آموزش – آموزش یک مدل با یک تریلیون پارامتر با چندین مرحله RL گران است. اگرچه آموزش سلسله‌مراتبی هزینه‌های استنتاج (inference) را کاهش می‌دهد، اما بودجه اولیه آموزش همچنان بالا باقی می‌ماند که پتانسیل محدود کردن این رویکرد به آزمایشگاه‌های با بودجه بالا را دارد.

آنچه در ادامه باید تماشا کنید

نکات کاربردی برای متخصصان هوش مصنوعی

  • پرامپت‌ها را تنها اهرم خود ندانید – از خود بپرسید آیا رفتاری که در حال کدنویسی آن در پرامپت‌ها هستید، می‌تواند در عوض از طریق یک حلقه آموزشی مبتنی بر پاداش آموخته شود؟
  • استفاده از توکن را به یک هدف اصلی تبدیل کنید – از همان ابتدا سیگنال‌های آگاه از بودجه را اضافه کنید؛ مدل یاد خواهد گرفت که بین دقت و هزینه محاسباتی تعادل برقرار کند.
  • حلقه بازخورد را کامل کنید – سیستمی را مستقر کنید که به‌طور خودکار وظایف را ارائه دهد، نتایج را با پاسخ‌های قابل راستی‌آزمایی بسنجد و نتایج را دوباره به فرآیند آموزش بازگرداند. این حلقه همان جایی است که مدل جریان کاری خود را کشف می‌کند.

زمانی که پاداش شفاف باشد و محیط بتواند موفقیت را به‌طور قابل‌اعتمادی اندازه‌گیری کند، مقیاس‌پذیری مدل فراتر از افزودن ظرفیت خام است؛ این کار به مدل می‌آموزد که چگونه انتخاب کند که چگونه فکر کند. این تغییر از داربست‌بندی‌های دستی به سمت استدلال خودگردان می‌تواند نحوه ساخت و قیمت‌گذاری عامل‌های هوش مصنوعی را بازتعریف کند.