యాక్షన్ లేబుల్స్ లేకుండానే ప్రత్యేక రోబోటిక్స్‌తో సమానంగా పనిచేస్తున్న చైనా యొక్క Orca వరల్డ్ మోడల్

చైనా పరిశోధకుల నుండి వచ్చిన ఒక విప్లవాత్మక ఆవిష్కరణ, ప్రత్యక్ష పర్యవేక్షణ లేకుండానే ఒక ఏకీకృత వరల్డ్ మోడల్ రోబోటిక్స్‌లో నైపుణ్యం సాధించగలదని నిరూపిస్తూ, AI మేధస్సు యొక్క ప్రాథమిక నిర్వచనాన్ని సవాలు చేస్తోంది. వీడియోల ద్వారా ప్రపంచం ఎలా మారుతుందో కేవలం గమనించడం ద్వారానే, ఒక AI సంక్లిష్టమైన భౌతిక చర్యలను నిర్వహించగల లోతైన అంతర్గత అవగాహనను పెంపొందించుకోగలదని Orca మోడల్ నిరూపిస్తోంది.

ద్వంద్వ-నేర్చుకునే ఇంజిన్: అన్ కాన్షియస్ (Unconscious) మరియు కాన్షియస్ (Conscious) మోడ్‌లు

Orca తన అంతర్గత "వరల్డ్ స్టేట్" (world state)ను నిర్మించడానికి రెండు పద్ధతుల శిక్షణ విధానాన్ని ఉపయోగించడం ద్వారా సాంప్రదాయ ప్రత్యేక మోడల్స్ నుండి భిన్నంగా ఉంటుంది. మొదటి పద్ధతి, "అన్ కాన్షియస్ లెర్నింగ్" (unconscious learning), ఇందులో లేబుల్ చేయని 1,25,000 గంటల వీడియోలను ప్రాసెస్ చేయడం జరుగుతుంది. ఈ దశలో, మోడల్ ఒక అబ్‌స్ట్రాక్ట్ స్పేస్‌లో భవిష్యత్తు ఫ్రేమ్‌లను అంచనా వేస్తుంది, దీనివల్ల ఒక్క క్యాప్షన్ కూడా అవసరం లేకుండానే కదలికల నమూనాలు (motion patterns), వస్తువుల అడ్డంకులు (object occlusions) మరియు దృశ్య గతిశీలతను (scene dynamics) అర్థం చేసుకోవడానికి వీలవుతుంది.

రెండవ పద్ధతి, "కాన్షియస్ లెర్నింగ్" (conscious learning), ఇందులో మాటల ద్వారా ఇచ్చే సూచనలు మరియు వివరణలను ఉపయోగిస్తారు. వీడియోలను విభజించడం మరియు దాని ఫలితంగా వచ్చే స్థితి మార్పులకు లేబుల్స్ వేయడం ద్వారా, ఒక నిర్దిష్ట చర్యకు మరియు దాని భౌతిక ఫలితానికి మధ్య ఉన్న కారణ-ప్రభావ సంబంధాన్ని (causal relationship) Orca నేర్చుకుంటుంది. ఈ కలయిక ద్వారా మోడల్ ప్రాథమిక దృశ్య అవగాహన (raw visual perception) మరియు ఉన్నత స్థాయి భాషా తర్కం (high-level linguistic reasoning) మధ్య ఉన్న అంతరాన్ని పూరించగలదు.

మార్చుకోగలిగే ఇంటెలిజెన్స్ మాడ్యూల్స్‌తో కూడిన ఫ్రోజెన్ కోర్ (Frozen Core)

Orca యొక్క ఆర్కిటెక్చర్ అత్యంత బహుముఖ ప్రజ్ఞ కోసం రూపొందించబడింది. ఇది ప్రీ-ట్రైన్డ్ Qwen3.5 లాంగ్వేజ్-ఇమేజ్ మోడల్‌ను "ఫ్రోజెన్ కోర్" (frozen core)గా ఉపయోగిస్తుంది. ప్రతి పని కోసం మొత్తం వ్యవస్థను మళ్ళీ ట్రైన్ చేసే బదులు, పరిశోధకులు ఈ స్థిరమైన పునాదికి ప్రత్యేకమైన, తేలికపాటి "హెడ్స్" (heads)ను జోడిస్తారు:

  • టెక్స్ట్ అవుట్‌పుట్: ఇప్పటికే ఉన్న Qwen3.5 లాంగ్వేజ్ హెడ్‌ను ఉపయోగిస్తుంది.
  • ఇమేజ్ జనరేషన్: అంతర్గత వరల్డ్ స్టేట్‌ను విజువల్ ప్రిడిక్షన్‌లుగా మార్చడానికి Stable Diffusion 3.5కి అనుసంధానించబడిన చిన్న అడాప్టర్లను ఉపయోగిస్తుంది.
  • రోబోట్ కంట్రోల్: వరల్డ్ స్టేట్‌లను భౌతిక కదలికలుగా మార్చడానికి ప్రత్యేకంగా శిక్షణ పొందిన కస్టమ్-బిల్ట్ "Action Expert" మాడ్యూల్‌ను ఉపయోగిస్తుంది.

ఈ మాడ్యులారిటీ వల్ల మోడల్ ఒక ప్రశ్నకు సమాధానం ఇస్తున్నా, వీడియోను జనరేట్ చేస్తున్నా లేదా మెకానికల్ ఆర్మ్‌ను నియంత్రిస్తున్నా, ప్రపంచం పట్ల దాని కేంద్ర అవగాహన స్థిరంగా ఉంటుంది.

ప్రత్యేక మోడల్స్ మరియు దిగ్గజాలను అధిగమించడం

Orca-4B యొక్క పనితీరు గణాంకాలు గణనీయంగా ఉన్నాయి. టెక్స్ట్-ఆధారిత వీడియో బెంచ్‌మార్క్‌లలో, Orca-4B సగటున 51.8 శాతం సాధించింది, ఇది Emu3 (34B) వంటి చాలా పెద్ద మోడల్స్ మరియు DeepSeek-VL2-3B వంటి ప్రత్యేక VLMs కంటే మెరుగ్గా ఉంది. PRICE-V0.1 బెంచ్‌మార్క్ ద్వారా ఇమేజ్ ప్రిడిక్షన్ టాస్క్‌లలో, Orca-4B 59.8 శాతం స్కోరు సాధించి, FLUX.2 small వంటి హై-ఎండ్ జనరేటర్లను అధిగమించింది.

అత్యంత ఆశ్చర్యకరంగా, బౌల్స్ పేర్చడం మరియు చక్కెరను తీయడం వంటి ఐదు మానిప్యులేషన్ టాస్క్‌లలో, రోబోటిక్ యాక్షన్ డేటాపై మాత్రమే నిర్మించబడిన $\pi$0.5 సిస్టమ్‌తో Orca సమానమైన పనితీరును కనబరిచింది. ముఖ్యంగా, తన భారీ ప్రీ-ట్రైనింగ్ దశలో ఎప్పుడూ యాక్షన్ లేబుల్‌ను చూడకుండానే Orca దీనిని సాధించింది. ప్రత్యేక మోడల్స్ తరచుగా రిపిటేటివ్ లూప్‌లలో చిక్కుకుపోయే చోట, Orca వైఫల్యం చెందిన గ్రిప్స్‌ను మళ్ళీ ప్రయత్నించడం ద్వారా మెరుగైన ఎర్రర్ రికవరీని కూడా ప్రదర్శించింది.

AI భవిష్యత్తుకు ఇది ఎందుకు ముఖ్యం

ఆధునిక రోబోటిక్స్‌లో ఉన్న అతిపెద్ద అడ్డంకులలో ఒకటైన లేబుల్ చేయబడిన యాక్షన్ డేటా కొరతను Orca పరిష్కరిస్తుంది. ఒక AI కేవలం పరిశీలన ద్వారా "ప్రపంచ భౌతిక శాస్త్రాన్ని" (physics of the world) నేర్చుకోగలదని నిరూపించడం ద్వారా, ఈ పరిశోధన మిలియన్ల గంటల మాన్యువల్, హ్యాండ్-లేబుల్డ్ టెలిఆపరేషన్ డేటా అవసరం లేకుండానే కొత్త వాతావరణాలలో మోహరించగలిగే జనరల్-పర్పస్ రోబోట్‌లకు మార్గం సుగమం చేస్తుంది.

ముఖ్య అంశాలు

  • అన్‌సూపర్‌వైజ్డ్ ఫౌండేషన్: Orca లేబుల్ చేయని వీడియోల "అన్ కాన్షియస్ లెర్నింగ్" ద్వారా ప్రపంచ గతిశీలతను నేర్చుకుంటుంది, దీనివల్ల ఖరీదైన హ్యూమన్-అనోటేటెడ్ డేటాసెట్‌లపై ఆధారపడటం తగ్గుతుంది.
  • మాడ్యులర్ ఆర్కిటెక్చర్: మార్చుకోగలిగే అడాప్టర్లతో కూడిన ఫ్రోజెన్ Qwen3.5 కోర్ వాడటం వల్ల, ఒకే మోడల్ టెక్స్ట్, ఇమేజ్ మరియు రోబోటిక్ కంట్రోల్‌లో ఒకేసారి నైపుణ్యం సాధించగలదు.
  • రోబోటిక్ పారిటీ: ప్రీ-ట్రైనింగ్ సమయంలో యాక్షన్ లేబుల్స్‌తో ఎటువంటి సంబంధం లేకపోయినప్పటికీ, మానిప్యులేషన్ టాస్క్‌లలో Orca-4B ప్రత్యేక రోబోటిక్ సిస్టమ్స్ యొక్క పనితీరుతో సమానంగా ఉంది.