Penyelidik telah mengumumkan rangka kerja pembelajaran pengukuhan baharu yang dipanggil Ring-Zero yang membolehkan model bahasa trilion-parameter belajar untuk menaakul sambil kekal dalam had bajet token, dan model tersebut mencatatkan skor 84.2% dalam peperiksaan matematik AIME 2026. Keputusan ini menunjukkan bahawa, pada skala ini, model tersebut boleh memperoleh tabiat penyelesaian masalah langkah demi langkah yang biasanya dikodkan secara keras oleh jurutera ke dalam prompt.

Mengapa ia penting

Prestasi tahap AIME telah lama menjadi penanda aras bagi penaakulan kuantitatif "tahap manusia". Mencapai julat 84.2% tanpa sebarang contoh tulisan manusia menunjukkan bahawa keupayaan penaakulan model tersebut muncul daripada dinamik latihan itu sendiri, bukannya daripada perancah (scaffolds) yang dibuat secara manual. Bagi syarikat yang membina ejen AI, implikasinya adalah jelas: penulisan dan penyelenggaraan resipi prompt yang rumit boleh digantikan dengan gelung latihan yang mengajar model bila perlu berfikir lebih mendalam dan bila jalan pintas yang murah sudah mencukupi.

Daripada kejuruteraan prompt kepada dinamik latihan

Selama bertahun-tahun, pembangun bergantung kepada templat prompt seperti "pecahkan masalah kepada bahagian-bahagian" atau "sahkan jawapan anda" untuk mendorong model bahasa besar melakukan penaakulan pelbagai langkah. Templat tersebut bertindak sebagai perancah luaran; model mengikut arahan tetapi tidak menghadam proses tersebut secara dalaman. Ring-Zero mengubah paradigma tersebut. Model menerima penerangan tugas bersama dengan jawapan yang boleh disahkan—kebenaran asas (ground-truth) yang boleh disemak secara automatik. Ia kemudian menjana siri percubaan, menerima ganjaran hanya apabila percubaan tersebut sepadan dengan jawapan yang boleh disahkan, dan mengemas kini dasarnya melalui pembelajaran pengukuhan.

Oleh kerana ganjaran tersebut terikat kepada objektif yang sukar untuk ditipu (jawapan mestilah betul, bukan sekadar munasabah), model tersebut menemui corak penaakulan dengan sendirinya. Kertas kerja tersebut berhujah bahawa sebaik sahaja isyarat ganjaran yang boleh dipercayai tersedia, penskalaan model kepada trilion parameter secara automatik akan memunculkan jenis helah kejuruteraan prompt yang sebelum ini dimasukkan secara manual oleh jurutera untuk model yang lebih kecil.

Saluran latihan empat langkah

Latihan Ring-Zero melalui empat peringkat yang berbeza:

  1. RL peringkat pertama – Model meneroka jejak penaakulan yang mungkin, mempelajari urutan token mana yang cenderung membawa kepada jawapan yang betul.
  2. Penyulingan kendiri – Jejak berkualiti tinggi mengalir semula ke dalam model, menstabilkan corak penaakulan yang muncul.
  3. RL peringkat kedua – Gelung yang lebih halus memperhalusi dasar sambil mengekalkan penambahbaikan sebelumnya.
  4. Latihan berperingkat – Model belajar untuk memperuntukkan bajet token secara bijak, memilih antara laluan penaakulan pendek (≈2k token) dan panjang (≈20k token) bergantung pada kesukaran masalah.

Latihan berperingkat adalah bahagian yang paling relevan untuk pengeluaran. Dalam pelaksanaan sebenar, setiap token tambahan menambah kos pengiraan. Dengan mengajar model untuk mengenali bila sesuatu masalah cukup mudah untuk jawapan pendek dan bila ia memerlukan analisis mendalam pelbagai langkah, Ring-Zero menghubungkan kualiti penaakulan secara langsung dengan kecekapan ekonomi.

Dua fasa pembelajaran: penemuan dan penajaman

Penulis menyifatkan lengkung pembelajaran sebagai proses dua fasa:

  • Penemuan – Langkah awal pembelajaran pengukuhan adalah bising (noisy); model mencuba pelbagai strategi, yang kebanyakannya gagal. Varians ini penting untuk mendedahkan laluan penaakulan baharu.
  • Penajaman – Sebaik sahaja corak yang menjanjikan muncul, langkah RL kemudiannya memperketat dasar, mengurangkan varians dan memantapkan tingkah laku tersebut.

Kemajuan ini mencerminkan cara manusia bertambah baik: sumbang saran awal diikuti oleh latihan yang fokus. Wawasan utama adalah bahawa peringkat awal yang "bercelaru" harus diterima dan bukannya disekat, kerana ia membekalkan bahan mentah untuk penambahbaikan kemudian.

Apa yang boleh silap?

Optimisme kertas kerja ini bergantung kepada beberapa andaian yang memerlukan penelitian:

  • Reka bentuk ganjaran – Rangka kerja ini memerlukan ganjaran yang boleh disahkan dan tahan terhadap jalan pintas. Bagi banyak tugas dunia sebenar, menentukan ganjaran sedemikian bukanlah perkara mudah dan mungkin memerlukan saluran anotasi yang mahal.
  • Kekangan persekitaran – Penulis menyatakan bahawa prestasi model tidak dihadkan oleh saiznya tetapi oleh infrastruktur penilaian di sekelilingnya (set ujian, log, metrik yang jelas). Membina dan menyelenggara infrastruktur tersebut boleh menjadi usaha kejuruteraan yang besar.
  • Kos pengiraan latihan – Melatih model trilion-parameter dengan pelbagai peringkat RL adalah mahal. Walaupun latihan berperingkat mengurangkan kos inferens, bajet latihan pendahuluan tetap tinggi, yang berpotensi mengehadkan pendekatan ini kepada makmal yang mempunyai dana yang besar.

What to watch next

Practical takeaways for AI practitioners

  • Don’t treat prompts as the only lever – Ask whether a behavior you are coding into prompts could instead be learned through a reward-driven training loop.
  • Make token usage a first-class objective – Add budget-aware signals early; the model will learn to balance accuracy against compute cost.
  • Close the feedback loop – Deploy a system that automatically supplies tasks, measures outcomes against verifiable answers, and feeds the results back into training. The loop is where the model discovers its own workflow.

When the reward is clear and the environment can measure success reliably, scaling up the model does more than add raw capacity—it teaches the model to choose how to think. That shift from hand-written scaffolding to self-directed reasoning could reshape how we build and price AI agents.