இந்த மாத Hugging Face ஆய்வுக் கட்டுரைகளின் தரவரிசை, இந்தத் துறை வளர்ந்து வருவதைக் காட்டுகிறது. முக்கியமான ஆய்வுகள் வெறும் அளவுருக்களின் (parameter counts) எண்ணிக்கையை அதிகரிப்பதைக் காட்டிலும், மாதிரிகள் (models) பார்ப்பதற்கும், நினைவில் கொள்வதற்கும் மற்றும் தொடங்கிய வேலையை முடிப்பதற்கும் முக்கியத்துவம் அளிக்கின்றன. கீழே உள்ள பத்து ஆய்வுக் கட்டுரைகள் நிகழ்நேர வீடியோ (real-time video), ரோபோட் அறிவாற்றல் (robot cognition), நேர்மையான மதிப்பீட்டு முறைகள் (honest benchmarking) மற்றும் உருவாக்கிகளை (generators) ஆசிரியர்களாகக் கருதும் அமைதியான புரட்சி ஆகியவற்றைப் பற்றிப் பேசுகின்றன.

நீங்கள் உண்மையில் பயன்படுத்தக்கூடிய நிகழ்நேர வீடியோ (Real-Time Video)

பெரும்பாலான வீடியோ மாதிரிகள் இன்னும் விலையுயர்ந்த ஆய்வக சோதனைகளைப் போலவே செயல்படுகின்றன. அவை கனமான வன்பொருள்களில் (heavy hardware) பல நிமிடங்கள் இயங்கி, நீங்கள் இடையில் மாற்ற முடியாத வீடியோக்களை உருவாக்குகின்றன. Vidu S1 இந்தச் சூழலை மாற்றுகிறது. இது நிகழ்நேரத் தொடர்பை (real-time interaction) இலக்காகக் கொண்டுள்ளது. TurboDiffusion எனப்படும் நுட்பத்தின் மூலம், சாதாரண நுகர்வோர் GPU-களில் இயங்கும் போது, பயனர்கள் குரல் கட்டளைகள் மூலம் டிஜிட்டல் கதாபாத்திரங்களை வழிநடத்த இது அனுமதிக்கிறது.

அந்த வன்பொருள் மாற்றம் முக்கியமானது. ஒரு மாதிரிக்கு இனி உயர்தர முடுக்கிகள் (top-tier accelerators) தேவையில்லை எனும் போது, அது ஒரு வெறும் விளக்கக்காட்சியாக (demo) இல்லாமல் ஒரு உள்கட்டமைப்பாக (infrastructure) மாறுகிறது. நிகழ்நேரத்தில் அரட்டைகளுக்கு (chat) எதிர்வினையாற்றும் நேரலை அவதாரங்கள் அல்லது தேவைக்கேற்ப பார்வையைச் சரிசெய்து குரல் தொனியை மாற்றும் வாடிக்கையாளர் சேவை கதாபாத்திரங்களைப் பற்றிச் சிந்தியுங்கள். Vidu S1 என்பது வெறும் ஆராய்ச்சித் தாளாக இல்லாமல், ஒரு தயாரிப்பாக வெளியாகும் வீடியோ AI-யை நோக்கிச் செல்கிறது.

வழிமுறைகளைப் புரிந்துகொள்ளும் ரோபோட்கள்

இயற்பியல் AI-க்கு (physical AI) வழிசெலுத்தல் (navigation) என்பது இன்னும் ஒரு அடிப்படைத் தடையாகும். ABot-N1 சாதாரண மொழி வழிமுறைகளால் இயக்கப்படும் ரோபோட் வழிசெலுத்தலுக்கான ஒரு அடிப்படை மாதிரியை (foundation model) முன்மொழிவதன் மூலம் இதைத் தீர்க்க முயல்கிறது. முன்கூட்டியே வரைபடமாக்கப்பட்ட நிலையான பாதைகளுக்குப் பதிலாக, தான் பார்ப்பது மற்றும் கேட்பதில் உள்ள வடிவங்களைக் கண்டறிவதன் மூலம் பல்வேறு சூழல்களில் நகர்வதைக் கற்றுக்கொள்ளும் இந்த அமைப்பு செயல்படுகிறது.

இதன் உடனடிப் பயன் தளவாடத் துறையில் (logistics) உள்ளது. "பைக் ரேக் தாண்டிச் செல்லும் பக்கவாட்டு நுழைவாயிலில் பார்சலை இறக்கவும்" போன்ற ஒரு வாய்மொழித் தகவலைப் பெறும் டெலிவரி ரோபோட், அந்தத் தகவலைப் பகுப்பாய்வு செய்து, பைக் ரேக் நகர்ந்தாலும் அதற்கேற்பத் தன்னை மாற்றிக்கொள்ள முடியும். வீட்டு உதவியாளர்கள் (Home assistants) முன்கூட்டியே துல்லியமான வரைபடங்கள் இல்லாமலேயே குடியிருப்புகளில் சுற்றிக் காணும் அதே நெகிழ்வுத்தன்மையைப் பெறுகின்றனர்.

நேற்றைய நிகழ்வுகளை நினைவில் கொள்ளும் ரோபோட்கள்

ABot-AgentOS அந்த வழிசெலுத்தல் பணிகளுடன் இணைந்து ஒரு வேறுபட்ட சிக்கலைத் தீர்க்கிறது: ரோபோட்கள் பொதுவாக ஒவ்வொரு கட்டளைக்குப் பிறகும் ரீசெட் (reset) ஆகிவிடுகின்றன. இந்த அமைப்பு இயந்திரத்தை பயனர்கள், பொருட்கள் மற்றும் அன்றாடப் பழக்கவழக்கங்களுக்கான நீண்டகால நினைவகம் கொண்ட ஒரு நிலையான முகவராக (persistent agent) treats செய்கிறது.

ஒருமுறை செயல்படும் செயலிக்கும் (one-time processor) தொடர்ச்சியான முகவருக்கும் (continuous agent) இடையிலான வேறுபாடு, ஒரு கருவிக்கும் ஒரு சக ஊழியருக்கும் இடையிலான வேறுபாட்டைப் போன்றது. கிடங்குத் தானியங்கி முறையில் (warehouse automation), நினைவகம் கொண்ட ஒரு ரோபோட், செவ்வாய்க்கிழமை வரும் சரக்குகளில் எப்போதும் உடையக்கூடிய பொருட்கள் இருப்பதை கவனித்து அதன் பிடியை (grip) மாற்றிக்கொள்ளும். வீட்டுப் பராமரிப்பில், ஒரு குறிப்பிட்ட குடியிருப்பாளர் மதியம் 3 மணிக்கு ஜன்னல் திரைகளை (blinds) பாதி திறந்த நிலையில் வைத்திருக்க விரும்புவதை அது நினைவில் கொள்ளும். அந்தத் தொடர்ச்சி பெரிய அளவில் தனிப்பயனாக்கத்தை (personalization at scale) சாத்தியமாக்குகிறது.

வீடியோ மதிப்பீட்டு முறைகளின் (Video Benchmarks) போலித்தனம்

Video-Oasis ஒரு சங்கடமான உண்மையை வெளிப்படுத்துகிறது: பல பிரபலமான வீடியோ புரிதல் மதிப்பீட்டு முறைகள் (video understanding benchmarks) தவறாக உள்ளன. மாதிரிகள் பெரும்பாலும் வெறும் உரை அறிவை (text knowledge) மட்டுமே பயன்படுத்தி கேள்விகளுக்குப் பதிலளிக்கின்றன, உண்மையான வீடியோ பிரேம்களை (frames) பார்க்கக்கூட முயற்சிப்பதில்லை. தற்போதைய மதிப்பீட்டு கேள்விகளில் பாதியினை எந்தவிதமான காட்சி உள்ளீடும் (visual input) இல்லாமலேயே தீர்க்க முடியும் என்பதை இந்த ஆய்வுக் கட்டுரை நிரூபிக்கிறது.

இதன் பொருள், ஆராய்ச்சியாளர்கள் உண்மையான உணர்தலை (genuine perception) விட, புத்திசாலித்தனமான யூகங்களுக்குத்தான் வெகுமதி அளித்து வருகிறார்கள் என்பதாகும். மாதிரிகள் ஒவ்வொரு பதிலையும் பிக்சல் அளவிலான ஆதாரங்களுடன் (pixel-level evidence) உறுதி செய்யக் கட்டாயப்படுத்தும் மதிப்பீட்டு நெறிமுறைகள் (evaluation protocols) சமூகத்திற்குத் தேவைப்படுகின்றன. இல்லையெனில், வெளிச்சம் மாறும்போது நம்பிக்கையுடன் தவறான தகவல்களை உருவாக்கும் (hallucinate) அமைப்புகளை நாம் சந்திக்க நேரிடும்.

நீண்ட வேலைகளை முடிக்கும் கோடிங் ஏஜெண்டுகள் (Coding Agents)

கோடிங் உதவியாளர்கள் சிறிய குறியீடுகளை (snippets) நன்றாக எழுதுகிறார்கள், ஆனால் நூற்றுக்கணக்கான படிகளைக் கொண்ட DevOps பணிப்பாய்வுகள் (workflows) இன்னும் சவாலாகவே உள்ளன. Long-Horizon-Terminal-Bench என்பது ஏஜெண்டுகள் நீண்ட காலப் பணிகளைக் கையாளுவது, இடையில் ஏற்படும் பிழைகளிலிருந்து மீண்டு வருவது மற்றும் மனித உதவியின்றி மீண்டும் திட்டமிடுவது ஆகியவற்றைச் சோதிக்கிறது.

தன்னாட்சி அமைப்பு நிர்வாகத்தை (autonomous system administration) கனவு காணும் எவருக்கும் இது முக்கியமானது. ஒரு சர்வரைப் புதுப்பிக்கவும் (patch), சார்புகளைச் (dependencies) சோதிக்கவும் மற்றும் ஒரு படி தோல்வியடைந்தால் பழைய நிலைக்குத் திரும்பவும் (roll back) கூடிய ஒரு ஏஜென்ட், சரியான Python குறியீட்டை எழுதினாலும் முதல் API key விடுபட்டவுடன் செயலிழந்துவிடும் ஒரு ஏஜென்ட்டை விட மிகவும் மதிப்புமிக்கது. இந்த மதிப்பீட்டு முறை ஆராய்ச்சியாளர்களுக்கு இத்தகையத் திறனை அளவிட ஒரு மதிப்பெண் பலகையை (scoreboard) வழங்குகிறது.

மலிவான வலுவூட்டல் கற்றல் (Reinforcement Learning)

Direct OPD வலுவூட்டல் கற்றலில் (reinforcement learning) உள்ள செலவுப் பிரச்சனையைத் தீர்க்கிறது. பெரிய மாதிரிகளுக்கான RL அதிகப் பணத்தையும் GPU நேரத்தையும் செலவிடுகிறது. முன்மொழியப்பட்ட குறுக்குவழி எளிமையானது: முதலில் ஒரு சிறிய மாதிரியை RL மூலம் பயிற்றுவித்து, பின்னர் அந்தப் பயிற்றுவிக்கப்பட்ட கொள்கையை (policy) ஒரு பெரிய மாதிரிக்கு மாற்ற வேண்டும்.

சிறிய மாதிரிகள் குறைந்த செலவில் தவறுகளைச் செய்து கற்றுக் கொள்ளும். ஒருமுறை உத்தி உறுதி செய்யப்பட்டதும், பெரிய மாதிரி முழுச் செலவும் செய்யாமல் அந்தப் பாடங்களைக் கற்றுக்கொள்ளும். பெரிய மொழி மாதிரிகளை (large language models) சீரமைக்க அல்லது ஏஜெண்டுகளை நுணுக்கமாக மாற்ற (fine-tune) முயற்சிக்கும் சிறிய குழுக்களுக்கு,