சீனாவின் Orca World Model, செயல் குறிச்சொற்கள் (Action Labels) இல்லாமலேயே சிறப்பு ரோபாட்டிக் திறன்களுக்கு இணையான ஆற்றலை வெளிப்படுத்துகிறது
சீன ஆராய்ச்சியாளர்களின் ஒரு புதிய கண்டுபிடிப்பு, நேரடி மேற்பார்வை இல்லாமலேயே ஒரு ஒருங்கிணைந்த உலக மாதிரி (unified world model) ரோபாட்டிக்ஸில் தேர்ச்சி பெற முடியும் என்பதை நிரூபிப்பதன் மூலம், AI நுண்ணறிவின் அடிப்படை வரையறையை சவாலுக்கு உட்படுத்துகிறது. வீடியோக்கள் மூலம் உலகம் எவ்வாறு மாறுகிறது என்பதை வெறும் கவனிப்பதன் மூலம், ஒரு AI சிக்கலான உடல் ரீதியான செயல்களைச் செய்யக்கூடிய ஆழமான உள் புரிதலை வளர்த்துக் கொள்ள முடியும் என்பதை Orca மாதிரி காட்டுகிறது.
இரட்டை கற்றல் இயந்திரம்: ஆழ்மன மற்றும் விழிப்புணர்வு முறைகள் (Unconscious and Conscious Modes)
Orca தனது உள் "உலக நிலையை" (world state) உருவாக்க, பாரம்பரிய சிறப்பு மாதிரிகளிலிருந்து மாறுபட்டு, இருமுனைப் பயிற்சி அணுகுமுறையைப் பயன்படுத்துகிறது. முதல் முறை, "unconscious learning" (ஆழ்மன கற்றல்), லேபிளிடப்படாத 125,000 மணிநேர வீடியோக்களைச் செயலாக்குவதை உள்ளடக்கியது. இந்த கட்டத்தில், மாதிரி ஒரு சுருக்கமான இடத்தில் (abstract space) எதிர்காலக் காட்சிகளைக் கணிக்கிறது, இது ஒரு விளக்கக் குறிப்பு (caption) கூடத் தேவையில்லாமல் இயக்க முறைகள், பொருட்களின் மறைவு மற்றும் காட்சி இயக்கவியலைப் புரிந்துகொள்ள உதவுகிறது.
இரண்டாவது முறை, "conscious learning" (விழிப்புணர்வு கற்றல்), வாய்மொழி அறிவுறுத்தல்கள் மற்றும் விளக்கங்களை அறிமுகப்படுத்துகிறது. வீடியோக்களைப் பிரிப்பதன் மூலமும், resulting state changes-களை லேபிளிங் செய்வதன் மூலமும், ஒரு குறிப்பிட்ட செயலுக்கும் அதன் உடல் ரீதியான விளைவுக்கும் இடையிலான காரண-காரியத் தொடர்பை Orca கற்றுக்கொள்கிறது. இந்தத் தொகுப்பு, வெறும் காட்சிப் புலனுணர்வுக்கும் (visual perception) உயர்நிலை மொழியியல் பகுத்தறிவுக்கும் (linguistic reasoning) இடையிலான இடைவெளியைக் குறைக்க இந்த மாதிரிக்கு உதவுகிறது.
மாற்றக்கூடிய நுண்ணறிவு தொகுதிகளுடன் கூடிய ஒரு நிலையான மையம் (Frozen Core)
Orca-வின் கட்டமைப்பு மிகுந்த பன்முகத்தன்மைக்காக வடிவமைக்கப்பட்டுள்ளது. இது முன்-பயிற்சி பெற்ற Qwen3.5 மொழி-படம் (language-image) மாதிரியை ஒரு "frozen core" ஆகப் பயன்படுத்துகிறது. ஒவ்வொரு பணிக்கும் முழு அமைப்பையும் மீண்டும் பயிற்றுவிப்பதற்குப் பதிலாக, ஆராய்ச்சியாளர்கள் இந்த நிலையான அடித்தளத்துடன் சிறப்பு வாய்ந்த, இலகுரக "heads"-களை இணைக்கிறார்கள்:
- உரை வெளியீடு (Text Output): தற்போதுள்ள Qwen3.5 மொழித் தலைப்பைப் (language head) பயன்படுத்துகிறது.
- பட உருவாக்கம் (Image Generation): உள் உலக நிலையை காட்சி முன்னறிவிப்புகளாக மாற்ற Stable Diffusion 3.5 உடன் இணைக்கப்பட்ட சிறிய அடாப்டர்களைப் (adapters) பயன்படுத்துகிறது.
- ரோபோக் கட்டுப்பாடு (Robot Control): உலக நிலைகளை உடல் ரீதியான இயக்கங்களாக மாற்றத் தனிப்பயனாக்கப்பட்ட "Action Expert" தொகுதியைப் பயன்படுத்துகிறது.
இந்த மாடுலர் (modular) அமைப்பு, மாதிரி ஒரு கேள்விக்கு பதிலளித்தாலும், ஒரு வீடியோவை உருவாக்கியாலும் அல்லது ஒரு இயந்திரக் கையைத் (mechanical arm) த controlled செய்தாலும், உலகின் மையப் புரிதல் சீராக இருப்பதை உறுதி செய்கிறது.
சிறப்பு மாதிரிகள் மற்றும் பெரும் நிறுவனங்களின் மாதிரிகளை விடச் சிறந்து விளங்குகிறது
Orca-4B-வின் செயல்திறன் அளவீடுகள் குறிப்பிடத்தக்கவை. உரை அடிப்படையிலான வீடியோ பெஞ்ச்மார்க்குகளில் (benchmarks), Orca-4B சராசரியாக 51.8 சதவீதத்தைப் பெற்றது, இது Emu3 (34B) போன்ற மிகப் பெரிய மாதிரிகள் மற்றும் DeepSeek-VL2-3B போன்ற சிறப்பு VLMs-களை விடச் சிறந்தது. PRICE-V0.1 பெஞ்ச்மார்க் மூலம் மேற்கொள்ளப்பட்ட பட முன்னறிவிப்புப் பணிகளில், Orca-4B 59.8 சதவீதத்தைப் பெற்று, FLUX.2 small போன்ற உயர்தரத் தயாரிப்புகளைத் தாண்டியுள்ளது.
மிகவும் வியக்கத்தக்க வகையில், கிண்ணங்களை அடுக்கி வைத்தல் மற்றும் சர்க்கரையைத் தூண்டுதல் போன்ற ஐந்து கையாளுதல் பணிகளில் (manipulation tasks), ரோபாட்டிக் செயல் தரவுகளில் (robotic action data) மட்டுமே கட்டமைக்கப்பட்ட $\pi$0.5 என்ற அமைப்புடன் Orca சமமானத் திறனை வெளிப்படுத்துகிறது. மிக முக்கியமாக, தனது பிரம்மாண்டமான முன்-பயிற்சி கட்டத்தின் போது ஒரு செயல் குறிச்சொல்லையும் (action label) பார்க்காமலேயே Orca இதைச் சாதித்துள்ளது. சிறப்பு மாதிரிகள் பெரும்பாலும் மீண்டும் மீண்டும் ஒரே செயலில் சிக்கிக்கொள்ளும் இடங்களில், தோல்வியுற்ற பிடிமானங்களை (grasps) மீண்டும் முயற்சிப்பதன் மூலம், இது சிறந்த பிழை மீட்புத் திறனையும் (error recovery) காட்டியது.
இது AI-யின் எதிர்காலத்திற்கு ஏன் முக்கியமானது
நவீன ரோபாட்டிக்ஸில் உள்ள மிக முக்கியமான தடைகளில் ஒன்றான லேபிளிடப்பட்ட செயல் தரவுகளின் (labeled action data) பற்றாக்குறையை Orca தீர்க்கிறது. ஒரு AI செயலற்ற கவனிப்பின் (passive observation) மூலம் "உலகின் இயற்பியலை" (physics of the world) கற்றுக்கொள்ள முடியும் என்பதை நிரூபிப்பதன் மூலம், இந்த ஆராய்ச்சி மில்லியன் கணக்கான மணிநேர மனித லேபிளிங் செய்யப்பட்ட டெலிஆப்பரேஷன் (teleoperation) தரவுகள் இன்றி, புதிய சூழல்களில் பயன்படுத்தக்கூடிய பொதுப் purpose ரோபோக்களுக்கான பாதையை வகுக்கிறது.
முக்கியக் குறிப்புகள்
- மேற்பார்வையற்ற அடிப்படை (Unsupervised Foundation): லேபிளிடப்படாத வீடியோக்களின் "unconscious learning" மூலம் Orca உலக இயக்கவியலைக் கற்றுக்கொள்கிறது, இது செலவு மிகுந்த மனிதக் குறிப்புத் தரவுத் தொகுப்புகளின் (human-annotated datasets) மீதான சார்பைக் குறைக்கிறது.
- மாடுலர் கட்டமைப்பு (Modular Architecture): மாற்றக்கூடிய அடாப்டர்களுடன் கூடிய ஒரு நிலையான Qwen3.5 மையத்தைப் பயன்படுத்துவது, ஒரே மாதிரியானது உரை, படம் மற்றும் ரோபோக் கட்டுப்பாடு ஆகியவற்றில் ஒரே நேரத்தில் சிறந்து விளங்க அனுமதிக்கிறது.
- ரோபாட்டிக் சமநிலை (Robotic Parity): முன்-பயிற்சியின் போது செயல் குறிச்சொற்கள் குறித்த முந்தைய அனுபவம் இல்லாவிட்டாலும், கையாளுதல் பணிகளில் Orca-4B சிறப்பு ரோபாட்டிக் அமைப்புகளின் செயல்திறனுக்கு இணையான திறனைப் பெறுகிறது.