या महिन्यातील Hugging Face पेपर रँकिंग्स या क्षेत्राची प्रगती दर्शवतात. यावेळचे महत्त्वाचे संशोधन केवळ पॅरामीटरची संख्या वाढवण्यावर नसून, मॉडेल्सना पाहणे, लक्षात ठेवणे आणि सुरू केलेले काम पूर्ण करणे शिकवण्यावर अधिक केंद्रित आहे. खालील दहा पेपर्स रिअल-टाइम व्हिडिओ, रोबोटिक कॉग्निशन, प्रामाणिक बेंचमार्किंग आणि जनरेटर्सना शिक्षकाप्रमाणे वापरण्याच्या शांत क्रांतीवर प्रकाश टाकतात.
तुम्ही प्रत्यक्षात वापरू शकणारा रिअल-टाइम व्हिडिओ
बहुतेक व्हिडिओ मॉडेल्स अजूनही महागड्या प्रयोगशाळेतील प्रयोगांसारखी वागतात. ते जड हार्डवेअरवर मिनिटांनु मिनिटे प्रक्रिया करतात आणि असे क्लिप्स देतात ज्यांना तुम्ही प्रक्रियेदरम्यान नियंत्रित करू शकत नाही. Vidu S1 हे समीकरण बदलते. हे रिअल-टाइम इंटरअॅक्शनवर लक्ष केंद्रित करते, ज्यामुळे वापरकर्ते व्हॉइस कमांडद्वारे डिजिटल पात्रांना निर्देश देऊ शकतात, तर हे मॉडेल TurboDiffusion नावाच्या तंत्राद्वारे सामान्य ग्राहक GPU वर चालते.
हा हार्डवेअरमधील बदल महत्त्वाचा आहे. जेव्हा एखादे मॉडेल उच्च दर्जाच्या अॅक्सिलरेटरच्या (accelerators) मोठ्या संचाची मागणी करत नाही, तेव्हा ते केवळ एक 'डेमो' न राहता पायाभूत सुविधा (infrastructure) बनते. रिअल-टाइममध्ये चॅटला प्रतिसाद देणारे लाइव्ह-स्ट्रीमिंग अवतार किंवा मागणीनुसार डोळ्यांत पाहून बोलणारे आणि आवाजाचा टोन बदलणारे कस्टमर-सर्व्हिस कॅरेक्टर्स यांचा विचार करा. Vidu S1 हे अशा व्हिडिओ AI कडे निर्देश करते जे केवळ एक रिसर्च प्रीप्रिंट नसून एक उत्पादन (product) म्हणून उपलब्ध असेल.
सूचना समजून घेणारे रोबोट्स
फिजिकल AI साठी नेव्हिगेशन (navigation) हा अजूनही एक मूलभूत अडथळा आहे. ABot-N1 सामान्य भाषेतील सूचनांवर आधारित रोबोट नेव्हिगेशनसाठी एक फाउंडेशन मॉडेल प्रस्तावित करून या समस्येवर उपाय शोधते. ठराविक किंवा पूर्व-नकाशावर आधारित मार्गांऐवजी, हे सिस्टम जे पाहते आणि ऐकते त्यातील पॅटर्न ओळखून विविध वातावरणातून हालचाल करायला शिकते.
याचा तात्काळ फायदा लॉजिस्टिक क्षेत्रात दिसून येईल. जर एखाद्या डिलिव्हरी रोबोटला "बाईक रॅकच्या पलीकडे असलेल्या बाजूच्या प्रवेशद्वारावर पॅकेज सोडा" अशी तोंडी सूचना दिली, तर तो ती सूचना समजून घेऊ शकेल आणि रॅक हलल्यास स्वतःमध्ये बदल करू शकेल. होम असिस्टंट्सनाही अशीच लवचिकता मिळेल, ज्यामुळे ते आधीपासून कोणतेही फ्लोअर प्लॅन अपलोड न करता अपार्टमेंटमध्ये फिरू शकतील.
कालच्या गोष्टी लक्षात ठेवणारे रोबोट्स
ABot-AgentOS नेव्हिगेशनच्या कामासोबतच एक वेगळी समस्या सोडवते: रोबोट्स सहसा प्रत्येक कमांडनंतर रिसेट होतात. ही प्रणाली मशीनला वापरकर्ते, वस्तू आणि दैनंदिन सवयींची दीर्घकालीन स्मृती (long-term memory) असलेला एक पर्सिस्टंट एजंट (persistent agent) मानते.
एकदाच काम करणारा प्रोसेसर आणि सतत कार्यरत राहणारा एजंट यांच्यातील फरक हा एका साधनाचा आणि सहकाऱ्याचा फरक आहे. वेअरहाऊस ऑटोमेशनमध्ये, स्मृती असलेला रोबोट हे लक्षात ठेवतो की मंगळवारच्या शिपमेंटमध्ये नेहमी नाजूक वस्तू असतात आणि त्यानुसार आपली पकड (grip) समायोजित करतो. घरगुती काळजी घेण्याच्या बाबतीत, तो लक्षात ठेवतो की एखादा विशिष्ट रहिवासी दुपारी ३ वाजता पडदे अर्धे उघडे ठेवणे पसंत करतो. ही सातत्यपूर्णता मोठ्या प्रमाणावर वैयक्तिकीकरण (personalization) शक्य करते.
व्हिडिओ बेंचमार्क्सचा पर्दाफाश
Video-Oasis एक अस्वस्थ करणारा निष्कर्ष मांडते: अनेक लोकप्रिय व्हिडिओ समजून घेण्याचे बेंचमार्क्स (benchmarks) दोषपूर्ण आहेत. मॉडेल्स अनेकदा केवळ मजकुराच्या ज्ञानाचा वापर करून प्रश्नांची उत्तरे देतात, प्रत्यक्ष फ्रेमकडे लक्षही देत नाहीत. हे पेपर सिद्ध करते की सध्याच्या बेंचमार्कमधील अर्ध्या प्रश्नांची उत्तरे कोणत्याही व्हिज्युअल इनपुटशिवाय देता येतात.
याचा अर्थ असा की संशोधक केवळ चपळ अंदाज लावणाऱ्या मॉडेल्सना पुरस्कृत करत आहेत, त्यांच्या खऱ्या आकलन शक्तीला नाही. समुदायाला अशा मूल्यमापन प्रोटोकॉलची (evaluation protocols) गरज आहे जे मॉडेल्सना प्रत्येक उत्तरासाठी पिक्सेल-स्तरीय पुराव्यांचा आधार घेण्यास भाग पाडतील. अन्यथा, प्रकाश बदलल्यावर आत्मविश्वासाने चुकीची माहिती (hallucinate) देणारी सिस्टिम्स तयार होण्याचा धोका आहे.
दीर्घ कामे पूर्ण करणारे कोडिंग एजंट्स
कोडिंग असिस्टंट्स कोडचे छोटे भाग (snippets) चांगले लिहितात, परंतु शंभर टप्प्यांचे DevOps वर्कफ्लो अजूनही त्यांच्यासाठी कठीण आहेत. Long-Horizon-Terminal-Bench हे एजंट्स कशा प्रकारे दीर्घकालीन कामे हाताळतात, कामाच्या दरम्यान येणाऱ्या त्रुटींमधून सावरतात आणि मानवी मदतीशिवाय पुन्हा नियोजन करतात, याची चाचणी घेते.
स्वायत्त सिस्टम ॲडमिनिस्ट्रेशनचे (autonomous system administration) स्वप्न पाहणाऱ्यांसाठी हे अत्यंत महत्त्वाचे आहे. जो एजंट सर्व्हर पॅच करू शकतो, डिपेंडन्सीजवर डायग्नोस्टिक्स चालवू शकतो आणि एखादा टप्पा अयशस्वी झाल्यास प्रक्रिया मागे (roll back) घेऊ शकतो, तो केवळ परफेक्ट Python लिहिणाऱ्या पण पहिली API की न मिळाल्यास थांबणाऱ्या एजंटपेक्षा कितीतरी पटीने मौल्यवान आहे. हे बेंचमार्क संशोधकांना अशा प्रकारच्या सहनशक्तीसाठी (stamina) एक स्कोअरबोर्ड प्रदान करते.
स्वस्त रिइन्फोर्समेंट लर्निंग
Direct OPD रिइन्फोर्समेंट लर्निंगमधील खर्चाच्या समस्येवर उपाय शोधते. मोठ्या मॉडेल्ससाठी RL वापरल्यास खूप पैसा आणि GPU तास खर्च होतात. प्रस्तावित शॉर्टकट सोपा आहे: प्रथम एका लहान मॉडेलला RL सह प्रशिक्षित करा आणि नंतर ती शिकलेली पॉलिसी मोठ्या मॉडेलमध्ये हस्तांतरित करा.
लहान एक्सप्लोरर्स स्वस्त दरात चुका करतात. एकदा रणनीती सिद्ध झाली की, मोठे मॉडेल पूर्ण खर्च न करता त्यातून शिकलेले धडे आत्मसात करते. लार्ज लँग्वेज मॉडेल्स अलाइन (align) करण्याचा किंवा एजंट्स फाईन-ट्यून (fine-tune) करण्याचा प्रयत्न करणाऱ्या लहान टीम्ससाठी,
