పరిశోధకులు Ring-Zero అని పిలువబడే కొత్త రీఇన్‌ఫోర్స్‌మెంట్-లెర్నింగ్ ఫ్రేమ్‌వర్క్‌ను ప్రకటించారు. ఇది ఒక ట్రిలియన్-పారామీటర్ల లాంగ్వేజ్ మోడల్, టోకెన్-బడ్జెట్ పరిమితులకు లోబడి ఉంటూనే తార్కికతను (reasoning) నేర్చుకోవడానికి అనుమతిస్తుంది. ఈ మోడల్ 2026 AIME గణిత పరీక్షలో 84.2% స్కోరు సాధించింది. ఇంజనీర్లు సాంప్రదాయకంగా ప్రాంప్ట్‌లలో కోడ్ చేసిన దశలవారీ సమస్య పరిష్కార అలవాట్లను, ఈ స్థాయిలో మోడల్ స్వయంగా సంపాదించగలదని ఈ ఫలితం చూపుతోంది.

ఇది ఎందుకు ముఖ్యం

AIME-స్థాయి పనితీరు అనేది చాలా కాలంగా "మానవ స్థాయి" పరిమాణాత్మక తార్కికతకు (quantitative reasoning) ఒక బెంచ్‌మార్క్‌గా ఉంది. ఎటువంటి మానవ-రచిత ఉదాహరణలు లేకుండానే 84.2% పరిధిని చేరుకోవడం అనేది, మోడల్ యొక్క తార్కిక సామర్థ్యాలు హ్యాండ్-క్రాఫ్టెడ్ స్కాఫోల్డ్స్ (hand-crafted scaffolds) నుండి కాకుండా, ట్రైనింగ్ డైనమిక్స్ నుండి ఉద్భవిస్తున్నాయని సూచిస్తుంది. AI ఏజెంట్లను నిర్మిస్తున్న కంపెనీలకు దీని అర్థం స్పష్టంగా ఉంది: సంక్లిష్టమైన ప్రాంప్ట్ రెసిపీలను రాయడం మరియు నిర్వహించడం แทน (instead of) మోడల్ ఎప్పుడు లోతుగా ఆలోచించాలి మరియు ఎప్పుడు తక్కువ ఖర్చుతో కూడిన షార్ట్‌కట్ సరిపోతుందో నేర్పించే ఒక ట్రైనింగ్ లూప్‌తో భర్తీ చేయవచ్చు.

ప్రాంప్ట్ ఇంజనీరింగ్ నుండి ట్రైనింగ్ డైనమిక్స్ వరకు

సంవత్సరాలుగా, డెవలపర్లు పెద్ద లాంగ్వేజ్ మోడల్స్‌ను మల్టీ-స్టెప్ రీజనింగ్ వైపు మళ్లించడానికి "సమస్యను భాగాలుగా విభజించండి" లేదా "మీ సమాధానాన్ని సరిచూసుకోండి" వంటి ప్రాంప్ట్ టెంప్లేట్‌లపై ఆధారపడ్డారు. ఆ టెంప్లేట్‌లు బాహ్య మద్దతుగా (external scaffolding) పనిచేస్తాయి; మోడల్ ఆ సూచనలను అనుసరిస్తుంది కానీ ఆ ప్రక్రియను అంతర్గతంగా నేర్చుకోదు. Ring-Zero ఆ పద్ధతిని మారుస్తుంది. మోడల్ ఒక టాస్క్ వివరణతో పాటు ఒక ధృవీకరించదగిన సమాధానాన్ని (verifiable answer) అందుకుంటుంది—ఇది ఆటోమేటిక్‌గా తనిఖీ చేయగల గ్రౌండ్-ట్రూత్. ఆ తర్వాత అది వరుస ప్రయత్నాలను చేస్తుంది, ఆ ప్రయత్నం ధృవీకరించదగిన సమాధానంతో సరిపోలినప్పుడు మాత్రమే రివార్డ్‌ను అందుకుంటుంది మరియు రీఇన్‌ఫోర్స్‌మెంట్ లెర్నింగ్ ద్వారా తన పాలసీని అప్‌డేట్ చేసుకుంటుంది.

రివార్డ్ అనేది మోసగించడానికి వీలులేని ఒక లక్ష్యంతో (సమాధానం కేవలం నమ్మదగినదిగా మాత్రమే కాకుండా, ఖచ్చితంగా ఉండాలి) ముడిపడి ఉండటం వల్ల, మోడల్ స్వయంగా రీజనింగ్ ప్యాటర్న్స్‌ను కనుగొంటుంది. ఒక నమ్మదగిన రివార్డ్ సిగ్నల్ అందుబాటులో ఉన్న once, మోడల్‌ను ట్రిలియన్ పారామీటర్లకు స్కేల్ చేయడం ద్వారా, చిన్న మోడళ్ల కోసం ఇంజనీర్లు మాన్యువల్‌గా చేర్చే ప్రాంప్ట్-ఇంజనీరింగ్ ట్రిక్స్ అన్నీ స్వయంచాలకంగా బయటకు వస్తాయని ఈ పరిశోధనా పత్రం వాదిస్తుంది.

నాలుగు దశల ట్రైనింగ్ పైప్‌లైన్

Ring-Zero ట్రైనింగ్ నాలుగు విభిన్న దశల ద్వారా జరుగుతుంది:

  1. First-stage RL – మోడల్ సాధ్యమయ్యే రీజనింగ్ ట్రేస్‌లను అన్వేషిస్తుంది, ఏ టోకెన్ సీక్వెన్స్‌లు సరైన సమాధానాలకు దారితీస్తాయో నేర్చుకుంటుంది.
  2. Self-distillation – అధిక నాణ్యత కలిగిన ట్రేస్‌లు తిరిగి మోడల్‌లోకి ప్రవహిస్తాయి, ఇది ఉద్భవిస్తున్న రీజనింగ్ ప్యాటర్న్స్‌ను స్థిరీకరిస్తుంది.
  3. Second-stage RL – మునుపటి మెరుగుదలలను కాపాడుతూ, ఒక సూక్ష్మమైన లూప్ పాలసీని మరింత మెరుగుపరుస్తుంది.
  4. Tiered training – సమస్య యొక్క కష్టాన్ని బట్టి చిన్న (≈2 k tokens) మరియు పెద్ద (≈20 k tokens) రీజనింగ్ మార్గాల మధ్య ఎంచుకుంటూ, టోకెన్ బడ్జెట్‌లను తెలివిగా కేటాయించడం మోడల్ నేర్చుకుంటుంది.

టియర్డ్ ట్రైనింగ్ అనేది ఉత్పత్తికి (production) అత్యంత సంబంధితమైన భాగం. వాస్తవ వినియోగంలో, ప్రతి అదనపు టోకెన్ కంప్యూట్ ఖర్చును పెంచుతుంది. ఒక సమస్య తక్కువ సమాధానానికి సరిపోలేంత సరళంగా ఉన్నప్పుడు మరియు ఎప్పుడు లోతైన, మల్టీ-స్టెప్ విశ్లేషణ అవసరమో గుర్తించేలా మోడల్‌కు నేర్పించడం ద్వారా, Ring-Zero రీజనింగ్ నాణ్యతను ఆర్థిక సామర్థ్యంతో నేరుగా ముడిపెడుతుంది.

నేర్చుకోవడంలో రెండు దశలు: డిస్కవరీ మరియు షార్పెనింగ్

రచయితలు ఈ లెర్నింగ్ కర్వ్‌ను రెండు దశల ప్రక్రియగా వివరిస్తారు:

  • Discovery – ప్రారంభ రీఇన్‌ఫోర్స్‌మెంట్-లెర్నింగ్ దశలు నాయిసీగా (noisy) ఉంటాయి; మోడల్ అనేక రకాల వ్యూహాలను ప్రయత్నిస్తుంది, వాటిలో చాలా వరకు విఫలమవుతాయి. కొత్త రీజనింగ్ మార్గాలను కనుగొనడానికి ఈ వైవిధ్యం (variance) అవసరం.
  • Sharpening – ఒక ఆశాజనకమైన ప్యాటర్న్ కనిపించిన తర్వాత, తరువాతి RL దశలు పాలసీని క్రమబద్ధీకరించి, వైవిధ్యాన్ని తగ్గించి, ఆ ప్రవర్తనను పటిష్టం చేస్తాయి.

ఈ పురోగతి మనుషులు ఎలా మెరుగుపడతారో దానికి ప్రతిరూపం: మొదట బ్రెయిన్‌స్టార్మింగ్, ఆ తర్వాత ఏకాగ్రతతో కూడిన సాధన. కీలకమైన విషయం ఏమిటంటే, ప్రారంభ దశలోని "అస్తవ్యస్తతను" అణచివేయడానికి బదులుగా స్వీకరించాలి, ఎందుకంటే అది తరువాతి మెరుగుదలలకు అవసరమైన ముడి పదార్థాన్ని అందిస్తుంది.

ఏవైనా సమస్యలు వచ్చే అవకాశం ఉందా?

ఈ పరిశోధనా పత్రంలోని ఆశావాదం కొన్ని ఊహలపై ఆధారపడి ఉంది, వీటిని పరిశీలించాల్సి ఉంది:

  • Reward design – ఫ్రేమ్‌వర్క్‌కు ధృవీకరించదగిన మరియు షార్ట్‌కట్‌లకు లొంగని రివార్డ్ అవసరం. అనేక వాస్తవ ప్రపంచ పనుల కోసం, అటువంటి రివార్డ్‌ను నిర్వచించడం అంత సులభం కాదు మరియు దీనికి ఖరీదైన అనోటేషన్ పైప్‌లైన్‌లు అవసరం కావచ్చు.
  • Environmental bottlenecks – మోడల్ పనితీరు దాని పరిమాణం వల్ల కాకుండా, చుట్టూ ఉన్న ఎవాల్యుయేషన్ ఇన్‌ఫ్రాస్ట్రక్చర్ (టెస్ట్ సూట్లు, లాగ్‌లు, స్పష్టమైన మెట్రిక్స్) వల్ల పరిమితం అవుతుందని రచయితలు పేర్కొన్నారు. ఆ మౌలిక సదుపాయాలను నిర్మించడం మరియు నిర్వహించడం అనేది గణనీయమైన ఇంజనీరింగ్ ప్రయత్నం కావచ్చు.
  • Compute cost of training – బహుళ RL దశలతో ట్రిలియన్-పారామీటర్ల మోడల్‌ను ట్రైన్ చేయడం ఖరీదైనది. టియర్డ్ ట్రైనింగ్ ఇన్ఫరెన్స్ ఖర్చులను తగ్గించినప్పటికీ, ప్రారంభ ట్రైనింగ్ బడ్జెట్ ఎక్కువగా ఉంటుంది, ఇది ఈ విధానాన్ని కేవలం భారీ నిధులు ఉన్న ల్యాబ్‌లకు మాత్రమే పరిమితం చేసే అవకాశం ఉంది.

తర్వాత ఏమి చూడాలి

AI నిపుణుల కోసం ఆచరణాత్మక అంశాలు

  • ప్రాంప్ట్‌లను మాత్రమే ఏకైక సాధనంగా పరిగణించవద్దు – మీరు ప్రాంప్ట్‌లలో కోడింగ్ చేస్తున్న ఒక ప్రవర్తనను, రివార్డ్-ఆధారిత ట్రైనింగ్ లూప్ (reward-driven training loop) ద్వారా నేర్చుకోగలమా అని ఆలోచించండి.
  • టోకెన్ వినియోగాన్ని ప్రాధాన్యత కలిగిన లక్ష్యంగా మార్చండి – బడ్జెట్-అవగాహన కలిగిన సిగ్నల్స్‌ను ముందుగానే జోడించండి; అప్పుడు మోడల్ ఖచ్చితత్వం (accuracy) మరియు కంప్యూట్ ఖర్చు (compute cost) మధ్య సమతుల్యతను పాటించడం నేర్చుకుంటుంది.
  • ఫీడ్‌బ్యాక్ లూప్‌ను పూర్తి చేయండి – పనులను స్వయంచాలకంగా అందిస్తూ, ధృవీకరించదగిన సమాధానాలతో ఫలితాలను కొలుస్తూ, ఆ ఫలితాలను తిరిగి ట్రైనింగ్‌కు పంపే వ్యవస్థను అమలు చేయండి. ఈ లూప్ ద్వారానే మోడల్ తన స్వంత వర్క్‌ఫ్లోను కనుగొంటుంది.

రివార్డ్ స్పష్టంగా ఉన్నప్పుడు మరియు వాతావరణం విజయవంతంగా కొలవగలిగినప్పుడు, మోడల్‌ను స్కేల్ చేయడం అంటే కేవలం సామర్థ్యాన్ని పెంచడం మాత్రమే కాదు—అది మోడల్‌కు ఎలా ఆలోచించాలో ఎంచుకోవడం నేర్పిస్తుంది. చేతితో రాసిన స్క్యాఫోల్డింగ్ (hand-written scaffolding) నుండి స్వయం-నిర్దేశిత తర్కం (self-directed reasoning) వైపు జరిగే ఈ మార్పు, మనం AI ఏజెంట్లను ఎలా నిర్మిస్తాము మరియు వాటి ధరను ఎలా నిర్ణయిస్తాము అనే అంశాలను పునర్నిర్వచించగలదు.