پژوهشگران از یک چارچوب جدید یادگیری تقویتی به نام Ring-Zero رونمایی کردند که به یک مدل زبانی با یک تریلیون پارامتر اجازه میدهد ضمن رعایت محدودیتهای بودجه توکن، استدلال کردن را بیاموزد؛ این مدل در آزمون ریاضی AIME سال ۲۰۲۶ امتیاز ۸۴.۲٪ را کسب کرد. این نتیجه نشان میدهد که در این مقیاس، مدل میتواند عادتهای حل مسئله گامبهگام را که مهندسان بهطور سنتی در پرامپتها کدگذاری میکردند، به دست آورد.
چرا این موضوع اهمیت دارد
عملکرد در سطح AIME مدتهاست که معیاری برای استدلال کمی در «سطح انسانی» بوده است. رسیدن به محدوده ۸۴.۲٪ بدون استفاده از هیچ نمونهی نوشتهشده توسط انسان، نشان میدهد که تواناییهای استدلالی مدل از خودِ دینامیکهای آموزشی حاصل میشود، نه از داربستهای دستساز. برای شرکتهایی که در حال ساخت عاملهای هوش مصنوعی (AI agents) هستند، پیام روشن است: نوشتن و نگهداری دستورالعملهای پیچیده پرامپت میتواند با یک حلقه آموزشی جایگزین شود که به مدل میآموزد چه زمانی عمیقتر فکر کند و چه زمانی یک میانبر ارزان کافی است.
از مهندسی پرامپت تا دینامیکهای آموزشی
سالهاست که توسعهدهندگان برای ترغیب مدلهای زبانی بزرگ به استدلال چندمرحلهای، به قالبهای پرامپت مانند «مسئله را به بخشهای مختلف تقسیم کن» یا «پاسخ خود را تأیید کن» متکی بودهاند. این قالبها مانند یک داربست خارجی عمل میکنند؛ مدل دستورالعملها را دنبال میکند اما فرآیند را درونی نمیکند. Ring-Zero این پارادایم را تغییر میدهد. مدل یک شرح وظیفه را به همراه یک پاسخ قابل تأیید دریافت میکند—یک حقیقتِ پایه (ground-truth) که میتواند بهطور خودکار بررسی شود. سپس مجموعهای از تلاشها را تولید میکند، تنها زمانی پاداش دریافت میکند که تلاش با پاسخ قابل تأیید مطابقت داشته باشد، و سیاست (policy) خود را از طریق یادگیری تقویتی بهروزرسانی میکند.
از آنجایی که پاداش به هدفی گره خورده است که تقلب در آن دشوار است (پاسخ باید درست باشد، نه فقط باورپذیر)، مدل الگوهای استدلالی را بهتنهایی کشف میکند. این مقاله استدلال میکند که وقتی یک سیگنال پاداش قابل اعتماد برقرار شود، مقیاسبندی مدل تا یک تریلیون پارامتر بهطور خودکار همان ترفندهای مهندسی پرامپتی را آشکار میکند که مهندسان بهصورت دستی برای مدلهای کوچکتر وارد میکردند.
خط لوله آموزشی چهار مرحلهای
آموزش Ring-Zero از طریق چهار مرحله متمایز انجام میشود:
- مرحله اول RL – مدل ردپاهای استدلالی ممکن را جستجو میکند و میآموزد که کدام توالیهای توکن تمایل دارند به پاسخهای صحیح منجر شوند.
- خود-تقطیر (Self-distillation) – ردپاهای باکیفیت به مدل بازمیگردند و الگوهای استدلالی نوظهور را تثبیت میکنند.
- مرحله دوم RL – یک حلقه دقیقتر، سیاست (policy) را در عین حفظ بهبودهای قبلی، اصلاح میکند.
- آموزش سلسلهمراتبی (Tiered training) – مدل یاد میگیرد که بودجه توکنها را بهصورت هوشمند تخصیص دهد و بسته به دشواری مسئله، بین مسیرهای استدلالی کوتاه (≈۲ هزار توکن) و بلند (≈۲۰ هزار توکن) انتخاب کند.
آموزش سلسلهمراتبی مرتبطترین بخش با محیط عملیاتی است. در استقرارهای واقعی، هر توکن اضافی هزینه محاسباتی را افزایش میدهد. Ring-Zero با آموزش مدل برای تشخیص اینکه چه زمانی یک مسئله به اندازه کافی ساده است که با پاسخ کوتاه حل شود و چه زمانی نیازمند تحلیل عمیق و چندمرحلهای است، کیفیت استدلال را مستقیماً به کارایی اقتصادی پیوند میزند.
دو مرحله یادگیری: کشف و صیقلدهی
نویسندگان منحنی یادگیری را به عنوان یک فرآیند دو مرحلهای توصیف میکنند:
- کشف (Discovery) – مراحل اولیه یادگیری تقویتی نویز دارند؛ مدل استراتژیهای بسیار متنوعی را امتحان میکند که بسیاری از آنها شکست میخورند. این واریانس برای کشف مسیرهای استدلالی جدید ضروری است.
- صیقلدهی (Sharpening) – زمانی که یک الگوی امیدوارکننده ظاهر میشود، مراحل بعدی RL سیاست را منسجمتر کرده، واریانس را کاهش داده و رفتار را تثبیت میکنند.
این روند مشابه نحوه پیشرفت انسان است: طوفان فکری اولیه و به دنبال آن تمرین متمرکز. نکته کلیدی این است که مرحله اولیه «آشفته» باید به جای سرکوب شدن، مورد استقبال قرار گیرد، زیرا مواد اولیه را برای اصلاحات بعدی فراهم میکند.
چه مشکلاتی ممکن است پیش بیاید؟
خوشبینی این مقاله به چند فرض بستگی دارد که نیاز به بررسی دقیق دارند:
- طراحی پاداش – این چارچوب به پاداشی نیاز دارد که هم قابل تأیید باشد و هم در برابر میانبر زدن مقاوم باشد. برای بسیاری از وظایف دنیای واقعی، تعریف چنین پاداشی ساده نیست و ممکن است به خط لولههای برچسبگذاری (annotation) پرهزینه نیاز داشته باشد.
- گلوگاههای محیطی – نویسندگان اشاره میکنند که عملکرد مدل نه با اندازه آن، بلکه با زیرساختهای ارزیابی اطراف آن (مجموعه تستها، لاگها، معیارهای شفاف) محدود میشود. ساخت و نگهداری آن زیرساخت میتواند تلاش مهندسی قابل توجهی باشد.
- هزینه محاسباتی آموزش – آموزش یک مدل با یک تریلیون پارامتر با چندین مرحله RL گران است. اگرچه آموزش سلسلهمراتبی هزینههای استنتاج (inference) را کاهش میدهد، اما بودجه اولیه آموزش همچنان بالا باقی میماند که پتانسیل محدود کردن این رویکرد به آزمایشگاههای با بودجه بالا را دارد.
آنچه در ادامه باید تماشا کنید
نکات کاربردی برای متخصصان هوش مصنوعی
- پرامپتها را تنها اهرم خود ندانید – از خود بپرسید آیا رفتاری که در حال کدنویسی آن در پرامپتها هستید، میتواند در عوض از طریق یک حلقه آموزشی مبتنی بر پاداش آموخته شود؟
- استفاده از توکن را به یک هدف اصلی تبدیل کنید – از همان ابتدا سیگنالهای آگاه از بودجه را اضافه کنید؛ مدل یاد خواهد گرفت که بین دقت و هزینه محاسباتی تعادل برقرار کند.
- حلقه بازخورد را کامل کنید – سیستمی را مستقر کنید که بهطور خودکار وظایف را ارائه دهد، نتایج را با پاسخهای قابل راستیآزمایی بسنجد و نتایج را دوباره به فرآیند آموزش بازگرداند. این حلقه همان جایی است که مدل جریان کاری خود را کشف میکند.
زمانی که پاداش شفاف باشد و محیط بتواند موفقیت را بهطور قابلاعتمادی اندازهگیری کند، مقیاسپذیری مدل فراتر از افزودن ظرفیت خام است؛ این کار به مدل میآموزد که چگونه انتخاب کند که چگونه فکر کند. این تغییر از داربستبندیهای دستی به سمت استدلال خودگردان میتواند نحوه ساخت و قیمتگذاری عاملهای هوش مصنوعی را بازتعریف کند.
