Para peneliti mengumumkan kerangka kerja reinforcement learning baru bernama Ring-Zero yang memungkinkan model bahasa dengan satu triliun parameter belajar menalar sambil tetap berada dalam batas anggaran token, dan model tersebut meraih skor 84,2% pada ujian matematika AIME 2026. Hasil ini menunjukkan bahwa, pada skala ini, model dapat memperoleh kebiasaan pemecahan masalah langkah demi langkah yang selama ini secara tradisional dikodekan secara manual oleh para insinyur ke dalam prompt.

Mengapa ini penting

Performa tingkat AIME telah lama menjadi tolok ukur untuk penalaran kuantitatif "setingkat manusia". Mencapai rentang 84,2% tanpa contoh tertulis dari manusia menunjukkan bahwa kemampuan penalaran model muncul dari dinamika pelatihan itu sendiri, bukan dari perancah (scaffolds) yang dibuat secara manual. Bagi perusahaan yang membangun agen AI, implikasinya jelas: penulisan dan pemeliharaan resep prompt yang rumit dapat digantikan oleh loop pelatihan yang mengajarkan model kapan harus berpikir lebih keras dan kapan jalan pintas yang murah sudah cukup.

Dari rekayasa prompt ke dinamika pelatihan

Selama bertahun-tahun, pengembang mengandalkan templat prompt seperti "pecah masalah menjadi beberapa bagian" atau "verifikasi jawaban Anda" untuk memancing model bahasa besar melakukan penalaran multi-langkah. Templat tersebut bertindak sebagai perancah eksternal; model mengikuti instruksi tetapi tidak menginternalisasi prosesnya. Ring-Zero membalikkan paradigma tersebut. Model menerima deskripsi tugas bersama dengan jawaban yang dapat diverifikasi—sebuah kebenaran dasar (ground-truth) yang dapat diperiksa secara otomatis. Model kemudian menghasilkan serangkaian upaya, menerima imbalan (reward) hanya ketika upaya tersebut cocok dengan jawaban yang dapat diverifikasi, dan memperbarui kebijakannya (policy) melalui reinforcement learning.

Karena imbalan tersebut terikat pada tujuan yang sulit dicurangi (jawaban harus benar, bukan sekadar masuk akal), model menemukan pola penalaran dengan sendirinya. Makalah tersebut berpendapat bahwa setelah sinyal imbalan yang andal tersedia, penskalaan model hingga satu triliun parameter secara otomatis memunculkan jenis trik rekayasa prompt yang selama ini dimasukkan secara manual oleh para insinyur untuk model yang lebih kecil.

Alur pelatihan empat tahap

Pelatihan Ring-Zero berlangsung melalui empat tahap berbeda:

  1. RL tahap pertama – Model mengeksplorasi jejak penalaran yang memungkinkan, mempelajari urutan token mana yang cenderung mengarah ke jawaban yang benar.
  2. Self-distillation – Jejak berkualitas tinggi dialirkan kembali ke dalam model, menstabilkan pola penalaran yang muncul.
  3. RL tahap kedua – Loop yang lebih halus menyempurnakan kebijakan sambil tetap mempertahankan peningkatan sebelumnya.
  4. Pelatihan bertingkat (Tiered training) – Model belajar mengalokasikan anggaran token secara cerdas, memilih antara jalur penalaran pendek (≈2 ribu token) dan panjang (≈20 ribu token) tergantung pada tingkat kesulitan masalah.

Pelatihan bertingkat adalah bagian yang paling relevan untuk produksi. Dalam penerapan nyata, setiap tambahan token menambah biaya komputasi. Dengan mengajarkan model untuk mengenali kapan sebuah masalah cukup sederhana untuk jawaban pendek dan kapan memerlukan analisis mendalam multi-langkah, Ring-Zero secara langsung menghubungkan kualitas penalaran dengan efisiensi ekonomi.

Dua fase pembelajaran: penemuan dan penajaman

Penulis mendeskripsikan kurva pembelajaran sebagai proses dua fase:

  • Penemuan (Discovery) – Langkah-langkah reinforcement learning awal bersifat berisik (noisy); model mencoba berbagai macam strategi, yang banyak di antaranya gagal. Variansi ini sangat penting untuk mengungkap jalur penalaran baru.
  • Penajaman (Sharpening) – Setelah pola yang menjanjikan muncul, langkah RL selanjutnya memperketat kebijakan, mengurangi variansi, dan memperkuat perilaku tersebut.

Perkembangan ini mencerminkan cara manusia berkembang: curah pendapat (brainstorming) awal diikuti oleh latihan yang terfokus. Wawasan utamanya adalah bahwa tahap awal yang "berantakan" harus diterima alih-alih ditekan, karena tahap tersebut menyediakan bahan mentah untuk penyempurnaan di kemudian hari.

Apa yang bisa salah?

Optimisme makalah ini bergantung pada beberapa asumsi yang patut dicermati:

  • Desain imbalan (Reward design) – Kerangka kerja ini membutuhkan imbalan yang dapat diverifikasi sekaligus tahan terhadap jalan pintas. Untuk banyak tugas dunia nyata, menentukan imbalan semacam itu tidaklah mudah dan mungkin memerlukan alur anotasi yang mahal.
  • Hambatan lingkungan (Environmental bottlenecks) – Penulis menunjukkan bahwa performa model tidak dibatasi oleh ukurannya, melainkan oleh infrastruktur evaluasi di sekitarnya (kumpulan tes, log, metrik yang jelas). Membangun dan memelihara infrastruktur tersebut dapat menjadi upaya rekayasa yang besar.
  • Biaya komputasi pelatihan – Melatih model dengan satu triliun parameter dengan beberapa tahap RL sangatlah mahal. Meskipun pelatihan bertingkat memangkas biaya inferensi, anggaran pelatihan di muka tetap tinggi, yang berpotensi membatasi pendekatan ini hanya untuk laboratorium dengan pendanaan besar.

Apa yang perlu diperhatikan selanjutnya

Pelajaran praktis bagi praktisi AI

  • Jangan menganggap prompt sebagai satu-satunya tuas kendali – Tanyakan apakah perilaku yang Anda masukkan ke dalam prompt sebenarnya dapat dipelajari melalui loop pelatihan berbasis reward.
  • Jadikan penggunaan token sebagai tujuan utama – Tambahkan sinyal yang sadar anggaran sejak dini; model akan belajar menyeimbangkan akurasi terhadap biaya komputasi.
  • Tutup loop umpan balik – Terapkan sistem yang secara otomatis menyediakan tugas, mengukur hasil terhadap jawaban yang dapat diverifikasi, dan memasukkan kembali hasilnya ke dalam pelatihan. Loop tersebut adalah tempat model menemukan alur kerjanya sendiri.

Ketika reward sudah jelas dan lingkungan dapat mengukur keberhasilan secara andal, meningkatkan skala model tidak sekadar menambah kapasitas mentah—hal itu mengajarkan model untuk memilih cara berpikirnya. Pergeseran dari scaffolding yang ditulis secara manual ke penalaran mandiri dapat membentuk kembali cara kita membangun dan menentukan harga agen AI.