Watafiti wametangaza mfumo mpya wa kujifunza kwa kuimarisha (reinforcement-learning) unaoitwa Ring-Zero ambao unaruhusu modeli ya lugha yenye trilioni moja ya vigezo (trillion-parameter) kujifunza kufanya mantiki huku ikibaki ndani ya mipaka ya bajeti ya tokeni, na modeli hiyo ilipata 84.2 % kwenye mtihani wa hisabati wa AIME wa mwaka 2026. Matokeo haya yanaonyesha kuwa, katika kiwango hiki, modeli inaweza kupata tabia za utatuzi wa matatizo hatua kwa hatua ambazo wahandisi kawaida huweka moja kwa moja kwenye maelekezo (prompts).

Kwa nini ni muhimu

Utendaji wa kiwango cha AIME umekuwa kwa muda mrefu kipimo cha "kiwango cha binadamu" cha mantiki ya kiasi (quantitative reasoning). Kufikia kiwango cha 84.2 % bila mifano yoyote iliyoandikwa na binadamu kunaashiria kuwa uwezo wa modeli wa kufanya mantiki unatokana na mienendo ya mafunzo yenyewe, na si kutokana na mifumo ya msaada (scaffolds) iliyotengenezwa kwa mkono. Kwa kampuni zinazojenga mawakala wa AI, maana yake ni wazi: kuandika na kudumisha mbinu tata za maelekezo (prompt recipes) kunaweza kuchukuliwa na mzunguko wa mafunzo unaofundisha modeli ni lini ifikirie kwa kina na ni lini njia rahisi ya mkato itatosha.

Kutoka uhandisi wa maelekezo hadi mienendo ya mafunzo

Kwa miaka mingi, watengenezaji walitegemea mifumo ya maelekezo (prompt templates) kama vile “gawa tatizo katika sehemu” au “hakiki jibu lako” ili kuichochea modeli kubwa za lugha kufanya mantiki ya hatua nyingi. Mifumo hiyo hufanya kazi kama msaada wa nje; modeli hufuata maelekezo lakini haijengi mchakato huo ndani yake. Ring-Zero inabadilisha mfumo huo. Modeli inapokea maelezo ya kazi pamoja na jibu linaloweza kuhakikiwa—ukweli wa msingi (ground-truth) ambao unaweza kukaguliwa kiotomatiki. Kisha inatengeneza mfululizo wa majaribio, inapokea zawadi (reward) pale tu jaribio linapolingana na jibu linaloweza kuhakikiwa, na inaboresha sera yake kupitia reinforcement learning.

Kwa sababu zawadi hiyo inahusiana na lengo ambalo ni vigumu kudanganya (jibu lazima liwe sahihi, si tu linaloeleweka), modeli inagundua mifumo ya mantiki yenyewe. Makala haya yanajenga hoja kwamba mara tu ishara ya zawadi ya kuaminika inapowepo, kuongeza ukubwa wa modeli hadi trilioni moja ya vigezo kunatoa moja kwa moja aina za mbinu za uhandisi wa maelekezo ambazo wahandisi wameziweka kwa mkono kwa modeli ndogo.

Mchakato wa mafunzo wa hatua nne

Mafunzo ya Ring-Zero hupitia hatua nne tofauti:

  1. RL ya hatua ya kwanza – Modeli inachunguza njia zinazowezekana za mantiki, ikijifunza ni mfuatano gani wa tokeni unaoelekea kwenye majibu sahihi.
  2. Self-distillation – Njia zenye ubora wa juu hurudi kwenye modeli, zikistabilisha mifumo ya mantiki inayochipuka.
  3. RL ya hatua ya pili – Mzunguko wenye usahihi zaidi unaboresha sera huku ukihifadhi maboresho ya awali.
  4. Tiered training – Modeli inajifunza kugawa bajeti za tokeni kwa akili, ikichagua kati ya njia fupi za mantiki (≈2 k tokeni) na ndefu (≈20 k tokeni) kulingana na ugumu wa tatizo.

Tiered training ndiyo sehemu muhimu zaidi kwa matumizi ya vitendaji. Katika utekelezaji halisi, kila tokeni ya ziada huongeza gharama ya kompyuta. Kwa kuifundisha modeli kutambua ni lini tatizo ni rahisi kiasi cha kutoa jibu fupi na ni lini linahitaji uchambuzi wa kina wa hatua nyingi, Ring-Zero inaunganisha moja kwa moja ubora wa mantiki na ufanisi wa kiuchumi.

Awamu mbili za kujifunza: ugunduzi na uboreshaji

Waandishi wanaelezea mchakato wa kujifunza kama mchakato wa awamu mbili:

  • Ugunduzi (Discovery) – Hatua za awali za reinforcement-learning zina kelele (noisy); modeli inajaribu mbinu mbalimbali, nyingi zake zikishindwa. Tofauti hii ni muhimu kwa kugundua njia mpya za mantiki.
  • Uboreshaji (Sharpening) – Mara tu mfumo wenye matumaini unapojitokeza, hatua za baadaye za RL zinaboresha sera, zikipunguza tofauti na kuimarisha tabia hiyo.

Maendeleo haya yanafanana na jinsi binadamu anavyoboreka: mawazo ya awali yakifuatiwa na mazoezi ya makini. Wazo kuu ni kwamba hatua ya awali ya "vurugu" inapaswa kukubaliwa badala ya kuzuiliwa, kwa sababu inatoa malighafi kwa ajili ya uboreshaji wa baadaye.

Nini kinaweza kwenda vibaya?

Matumaini ya makala haya yanategemea mawazo machache yanayohitaji uchunguzi:

  • Usanifu wa zawadi (Reward design) – Mfumo unahitaji zawadi ambayo inaweza kuhakikiwa na inayozuia njia za mkato. Kwa kazi nyingi za ulimwengu halisi, kufafanua zawadi kama hiyo si jambo rahisi na kunaweza kuhitaji mifumo ya uandikishaji (annotation pipelines) yenye gharama kubwa.
  • Vikwazo vya mazingira (Environmental bottlenecks) – Waandishi wanaashiria kuwa utendaji wa modeli haujazuiliwa na ukubwa wake bali na miundombinu ya tathmini inayozunguka (test suites, logs, metrics zilizo wazi). Kujenga na kudumisha miundombinu hiyo kunaweza kuwa juhudi kubwa ya kihandisi.
  • Gharama ya kompyuta ya mafunzo – Kufundisha modeli yenye trilioni moja ya vigezo kwa hatua nyingi za RL ni ghali. Ingawa tiered training hupunguza gharama za inference, bajeti ya awali ya mafunzo inabaki kuwa kubwa, jambo ambalo linaweza kuifanya mbinu hii kuwa ya maabara zenye ufadhili mkubwa pekee.

Unachoweza kuangalia kufuatia

Mafunzo ya vitendo kwa watendaji wa AI

  • Usichukulie prompts kama nyenzo pekee – Jiulize ikiwa tabia unayoijumuisha kwenye prompts inaweza badala yake kujifunza kupitia mzunguko wa mafunzo unaoongozwa na zawadi.
  • Fanya matumizi ya tokeni kuwa lengo kuu – Ongeza ishara zinazozingatia bajeti mapema; modeli itajifunza kusawazisha usahihi dhidi ya gharama za uchakataji.
  • Funga mzunguko wa mrejesho – Imarisha mfumo unaotoa kazi kiotomatiki, unapima matokeo dhidi ya majibu yanayoweza kuthibitishwa, na kurejesha matokeo hayo kwenye mafunzo. Mzunguko huo ndipo modeli inapogundua mtiririko wake wa kazi.

Zawadi inapokuwa wazi na mazingira yanapoweza kupima mafanikio kwa uhakika, kuongeza ukubwa wa modeli kunafanya zaidi ya kuongeza uwezo wa ghafi—kunaiFundisha modeli kuchagua jinsi ya kufikiri. Mabadiliko hayo kutoka kwenye muundo uliandikwa kwa mkono kwenda kwenye mantiki inayojiongoza yanaweza kubadilisha jinsi tunavyojenga na kupanga bei ya mawakala wa AI.