इस महीने के Hugging Face पेपर रैंकिंग से पता चलता है कि यह क्षेत्र परिपक्व हो रहा है। मुख्य काम केवल पैरामीटर की संख्या बढ़ाने के बारे में नहीं है, बल्कि मॉडलों को देखने, याद रखने और अपने कार्यों को पूरा करने में सक्षम बनाने के बारे में है। नीचे दिए गए दस पेपर रियल-टाइम वीडियो, रोबोट कॉग्निशन, ईमानदार बेंचमार्किंग और जनरेटरों को शिक्षक के रूप में मानने वाली एक शांत क्रांति पर चर्चा करते हैं।

रियल-टाइम वीडियो जिसे आप वास्तव में उपयोग कर सकते हैं

अधिकांश वीडियो मॉडल अभी भी महंगे प्रयोगशाला प्रयोगों की तरह व्यवहार करते हैं। वे भारी हार्डवेयर पर मिनटों तक चलते हैं और ऐसे क्लिप निकालते हैं जिन्हें आप बीच में नियंत्रित नहीं कर सकते। Vidu S1 इस समीकरण को बदल देता है। यह रियल-टाइम इंटरैक्शन पर केंद्रित है, जिससे उपयोगकर्ता TurboDiffusion नामक तकनीक के माध्यम से मानक कंज्यूमर GPU पर चलते हुए वॉयस कमांड के साथ डिजिटल पात्रों को निर्देशित कर सकते हैं।

हार्डवेयर में यह बदलाव महत्वपूर्ण है। जब किसी मॉडल को अब टॉप-टियर एक्सेलेरेटर्स के रैक की आवश्यकता नहीं होती, तो वह केवल एक डेमो नहीं रह जाता बल्कि इंफ्रास्ट्रक्चर बन जाता है। ऐसे लाइव-स्ट्रीमिंग अवतारों के बारे में सोचें जो रियल-टाइम में चैट पर प्रतिक्रिया देते हैं, या कस्टमर-सर्विस पात्र जो मांग के अनुसार आंखों से संपर्क (eye contact) करते हैं और अपना लहजा बदलते हैं। Vidu S1 ऐसे वीडियो AI की ओर इशारा करता है जो केवल एक रिसर्च प्रीप्रिंट नहीं, बल्कि एक उत्पाद के रूप में उपलब्ध होता है।

रोबोट जो निर्देशों को समझते हैं

फिजिकल AI के लिए नेविगेशन अभी भी एक बुनियादी बाधा बना हुआ है। ABot-N1 साधारण भाषा के निर्देशों द्वारा संचालित रोबोट नेविगेशन के लिए एक फाउंडेशन मॉडल प्रस्तावित करके इस समस्या का समाधान करता है। नाजुक, पहले से मैप किए गए रास्तों के बजाय, यह सिस्टम जो देखता और सुनता है उसमें पैटर्न पहचानकर विभिन्न वातावरणों में चलना सीखता है।

इसका तत्काल लाभ लॉजिस्टिक्स में मिलता है। यदि किसी डिलीवरी रोबोट को "बाइक रैक के पार साइड एंट्रेंस पर पैकेज छोड़ दें" जैसा मौखिक संकेत दिया जाए, तो वह उस निर्देश को समझ सकता है और रैक के हिलने पर खुद को ढाल सकता है। होम असिस्टेंट को भी इसी तरह का लचीलापन मिलता है, जिससे वे पहले से अपलोड किए गए सटीक फ्लोर प्लान के बिना भी अपार्टमेंट में घूम सकते हैं।

रोबोट जो कल की बातें याद रखते हैं

ABot-AgentOS नेविगेशन कार्य के साथ मिलकर एक अलग समस्या का समाधान करता है: रोबोट आमतौर पर हर कमांड के बाद रीसेट हो जाते हैं। यह सिस्टम मशीन को उपयोगकर्ताओं, वस्तुओं और दैनिक आदतों के लिए लॉन्ग-टर्म मेमोरी वाले एक निरंतर एजेंट के रूप में मानता है।

एक बार काम करने वाले प्रोसेसर और एक निरंतर एजेंट के बीच का अंतर एक उपकरण और एक सहकर्मी के बीच के अंतर जैसा है। वेयरहाउस ऑटोमेशन में, मेमोरी वाला रोबोट यह नोटिस करता है कि मंगलवार की शिपमेंट में हमेशा नाजुक सामान होता है और वह अपनी पकड़ को एडजस्ट कर लेता है। घर की देखभाल के लिए, उसे याद रहता है कि एक विशिष्ट निवासी दोपहर 3 बजे ब्लाइंड्स (blinds) को आधा खुला रखना पसंद करता है। यह निरंतरता बड़े पैमाने पर पर्सनलाइजेशन को संभव बनाती है।

वीडियो बेंचमार्क की पोल खोलना

Video-Oasis एक असहज निदान देता है: कई लोकप्रिय वीडियो अंडरस्टैंडिंग बेंचमार्क दोषपूर्ण हैं। मॉडल अक्सर केवल टेक्स्ट ज्ञान का उपयोग करके प्रश्नों के उत्तर देते हैं, और वास्तविक फ्रेम देखने की जहमत भी नहीं उठाते। यह पेपर दर्शाता है कि वर्तमान बेंचमार्क के आधे प्रश्नों को बिना किसी विजुअल इनपुट के हल किया जा सकता है।

इसका मतलब है कि शोधकर्ता वास्तविक धारणा (perception) के बजाय चतुर अनुमानों को पुरस्कृत कर रहे हैं। समुदाय को ऐसे मूल्यांकन प्रोटोकॉल की आवश्यकता है जो मॉडलों को हर उत्तर को पिक्सेल-स्तर के साक्ष्य के आधार पर देने के लिए मजबूर करें। अन्यथा, हम ऐसे सिस्टम बनाने का जोखिम उठाते हैं जो रोशनी बदलने पर आत्मविश्वास के साथ मतिभ्रम (hallucinate) करने लगते हैं।

कोडिंग एजेंट जो लंबे काम पूरे करते हैं

कोडिंग असिस्टेंट स्निपेट्स तो अच्छे से लिख लेते हैं, लेकिन सौ चरणों वाले DevOps वर्कफ़्लो अभी भी उनके लिए एक चुनौती बने हुए हैं। Long-Horizon-Terminal-Bench यह परीक्षण करता है कि एजेंट लंबे कार्यों से कैसे निपटते हैं, बीच में होने वाली त्रुटियों से कैसे उबरते हैं, और बिना मानवीय सहायता के पुन: योजना (replan) कैसे बनाते हैं।

यह उन सभी के लिए महत्वपूर्ण है जो स्वायत्त सिस्टम प्रशासन (autonomous system administration) का सपना देखते हैं। एक ऐसा एजेंट जो सर्वर को पैच कर सके, डिपेंडेंसीज़ में डायग्नोस्टिक्स चला सके, और यदि कोई चरण विफल हो जाए तो रोलबैक कर सके, वह उस एजेंट की तुलना में कहीं अधिक मूल्यवान है जो परफेक्ट Python तो लिखता है लेकिन पहली मिसिंग API की (key) मिलते ही रुक जाता है। यह बेंचमार्क शोधकर्ताओं को इस तरह के स्टैमिना के लिए एक स्कोरबोर्ड प्रदान करता है।

सस्ता रीइन्फोर्समेंट लर्निंग

Direct OPD रीइन्फोर्समेंट लर्निंग में लागत की समस्या का समाधान करता है। बड़े मॉडलों के लिए RL बहुत अधिक पैसा और GPU घंटे खर्च करता है। प्रस्तावित शॉर्टकट सरल है: पहले RL के साथ एक छोटे मॉडल को प्रशिक्षित करें, फिर उस सीखे हुए पॉलिसी को एक बड़े मॉडल में ट्रांसफर करें।

छोटे एक्सप्लोरर्स कम लागत में गलतियाँ करते हैं। एक बार रणनीति प्रमाणित हो जाने के बाद, बड़ा मॉडल पूरी कीमत चुकाए बिना उन सीखों को अपना लेता है। उन लीन (lean) टीमों के लिए जो लार्ज लैंग्वेज मॉडल्स को अलाइन करने या एजेंटों को फाइन-ट्यून करने की कोशिश कर रही हैं,