Hugging Face आता केवळ 'मॉडेल झू' (model zoo) पेक्षाही अधिक प्रगत झाले आहे. तिथे सध्या ट्रेंड होणारे शोधनिबंध (papers) AI समुदाय नेमका कोणत्या दिशेने जात आहे, याचे दिशादर्शक म्हणून काम करतात. अनेक वर्षे, मुख्य प्रवाह साधा होता: पॅरामीटर्स वाढवा, डेटा वाढवा, कॉम्प्युट वाढवा. तो काळ संपलेला नाही, पण आता ती संपूर्ण गोष्ट राहिलेली नाही. अलीकडील प्रभावशाली शोधनिबंधांतून प्राधान्यक्रमात स्पष्ट बदल दिसून येत आहे. संशोधक आणि निर्माते आता हे प्रश्न अधिक गांभीर्याने विचारत आहेत की, ही प्रणाली वास्तवतेच्या कसोटीवर टिकते का. लक्ष आता केवळ मोठ्या प्रमाणाकडून (raw scale) कार्यान्वयनाकडे (operationalization) वळत आहे—मॉडेल्स कसे तर्क करतात (reason), ते स्वस्त हार्डवेअरवर कसे चालतात, ते एका सॉफ्टवेअर वातावरणातून दुसऱ्या वातावरणात कसे जातात आणि ते विज्ञानाची गती कशी वाढवतात.
दबावाखालीही टिकणारे तर्क (Reasoning)
आपण लार्ज लँग्वेज मॉडेल्सना कशा प्रकारे प्रशिक्षित करतो आणि त्यांचा वापर कसा करतो, यामध्ये वाढती दरी निर्माण होत आहे. एखादे मॉडेल प्रशिक्षणादरम्यान 'लॉस' (loss) अतिशय चांगल्या प्रकारे कमी करू शकते, तरीही कोडिंगमधील बग किंवा गणिती सिद्धता (math proof) सोडवताना ते अपयशी ठरू शकते. एका अलीकडील शोधनिबंधानुसार, याचे निराकरण केवळ प्रशिक्षणातील एखादी नवीन युक्ती (training trick) नसून, मॉडेल्स केवळ प्रशिक्षणातील मेट्रिक्सवर (training metrics) कसे गुण मिळवतात यापेक्षा, 'इन्फरन्स' (inference) दरम्यान ते कसे वागतात यावर लक्ष केंद्रित करणे आवश्यक आहे. बहुतेक 'रिइन्फोर्समेंट लर्निंग' (reinforcement learning) पाइपलाईन्स अजूनही प्रशिक्षणादरम्यान मिळणाऱ्या रिवॉर्ड्सच्या मागे धावत आहेत. प्रस्तावित बदलाचा अर्थ असा आहे की, 'चेन ऑफ थॉट' (chain of thought) स्वतः स्थिर करणे. कोडिंग असिस्टंट किंवा गणिती ट्युटर्स बनवणाऱ्यांसाठी, हा एक व्यावहारिक बदल आहे. केवळ लीडरबोर्डवरील अचूकतेवर विश्वास ठेवणे थांबवून, प्रॉम्प्ट क्लिष्ट झाल्यावर मॉडेलचे तर्कसंगत विचार (reasoning) सुसंगत राहतात का, याची 'स्ट्रेस-टेस्टिंग' (stress-testing) करायला सुरुवात करा.
जे शिकलेले लक्षात ठेवतात असे GUI एजंट्स
एजंट्सना प्लॅटफॉर्मची समस्या आहे. क्रोम टॅबमध्ये विमाने बुक करणारी प्रणाली, अँड्रॉइड फोनवरील सेटिंग्ज बदलण्यास सांगितल्यावर सर्व काही विसरू शकते. ही त्रुटी म्हणजे 'कॅटास्ट्रोफिक फॉरगेटिंग' (catastrophic forgetting). नवीन संशोधन 'मल्टी-टीचर डिस्टिलेशन' (multi-teacher distillation) द्वारे यावर उपाय शोधत आहे. एका इंटरफेसवर प्रशिक्षण देऊन ज्ञान हस्तांतरित होईल अशी अपेक्षा करण्याऐवजी, एजंट एकाच वेळी अनेक शिक्षकांकडून शिकतो, ज्यातील प्रत्येक शिक्षक एका वेगळ्या प्लॅटफॉर्ममध्ये तज्ज्ञ असतो. विद्यार्थी नेटवर्कला वेब, मोबाईल आणि डेस्कटॉप लॉजिकचा एकाच वेळी अनुभव येत असल्याने, ते जुनी कौशल्ये न गमावता विविध वातावरणांमध्ये काम करू शकते. उत्पादन टीमसाठी याचा अर्थ असा आहे की, तुम्ही आता दोन वेगळी एजंट प्रणाली हाताळण्याऐवजी, तुमचे वेब बॅकएंड आणि मोबाईल फ्रंटएंड या दोन्हीवर काम करणारा एकच असिस्टंट तयार करू शकता.
मोठ्या मॉडेल्सना वास्तव जगात आणणे
रोबोटवर एखादे मोठे फाउंडेशन मॉडेल चालवणे ही नेहमीच सॉफ्टवेअर समस्या असल्याचे भासणारी एक भौतिकशास्त्र (physics) समस्या राहिली आहे. मॉडेल सर्व्हर रॅकवर बसू शकेल, परंतु ते ड्रोनच्या पॉवर बजेटमध्ये किंवा मॅन्युफॅक्चरिंग आर्मच्या ऑनबोर्ड कॉम्प्युटरमध्ये बसणार नाही. हे अंतर भरून काढण्यासाठी एक नवीन C++ रनटाइम डिझाइन करण्यात आला आहे, जो जड मॉडेल्सना विविध प्रकारच्या रोबोट हार्डवेअर आणि एज डिव्हाइसेसवर (edge devices) पोर्ट करतो. हे केवळ वेगवान इन्फरन्ससाठी नाही, तर पोर्टेबिलिटीसाठी (portability) आहे. महागड्या GPUs वर प्रयोगशाळेत विकसित केलेले मॉडेल, पूर्णपणे पुन्हा न लिहिता थेट जेटसन मॉड्यूल (Jetson module) किंवा रोबोटच्या स्थानिक कंट्रोलरमध्ये वापरता येऊ शकते. ही पोर्टेबिलिटीच एखाद्या अनुदानित डेमोला (grant-funded demo) प्रत्यक्ष बाजारात येणाऱ्या उत्पादनापासून वेगळे करते.
डेटा फिल्टरपेक्षा डेटाची 'रेसिपी' अधिक महत्त्वाची आहे
व्हिजन-लँग्वेज मॉडेल्सना केवळ मोठ्या ताटांची नाही, तर चांगल्या आहाराची गरज आहे. नवीन बेंचमार्क्स एक कडू सत्य मांडतात: खराब डेटा फिल्टर करणे हा केवळ अर्धा लढा आहे. तुम्ही इमेज कॅप्शन्स, चार्ट पार्सिंग, ग्राउंडेड कन्वर्सेशन आणि व्हिज्युअल क्वेश्चन अनस्वरींग यांचे मिश्रण कोणत्या प्रमाणात करता, यावर तुमचे मल्टीमोडल असिस्टंट बारकावे समजून घेईल की केवळ चुकीचे संबंध (hallucinate) दाखवेल हे अवलंबून असते. जर रेसिपी चुकली, तर डेटा पूर्णपणे स्वच्छ असूनही मॉडेल अडखळते. यामुळे डेटासेट तयार करण्याचे काम केवळ 'स्वच्छता कर्मचाऱ्याच्या' (janitorial work) कामाकडून 'रेसिपी इंजिनिअरिंग'कडे वळत आहे. जर तुमची टीम व्हिज्युअल असिस्टंट बनवत असेल, तर केवळ तुमच्या फिल्टर्सची नाही, तर तुमच्या मिश्रणांची (mixtures) तपासणी करा.
पिक्सेल स्पेसमध्ये 3D जनरेशन
बहुतेक जनरेटिव्ह 3D पाइपलाईन्स जगाला एका लपलेल्या 'लॅटेंट स्पेस'मध्ये (latent space) संकुचित करतात. तपशील नाहीसे होतात. कडा अस्पष्ट होतात. जलद प्रिव्ह्यूसाठी ही माहितीची घट (lossiness) स्वीकारार्ह असू शकते, परंतु गेम अॅसेट किंवा AR ओव्हरलेसाठी, ज्याला वास्तविक भूमितीशी (geometry) जुळवून घ्यावे लागते, ते वापरण्यायोग्य नसते. उदयोन्मुख पद्धती हे अडथळे पूर्णपणे टाळून थेट पिक्सेल स्पेसमध्ये काम करत आहेत. परिणामी दृश्ये स्पष्ट राहतात, अवकाशीय संबंध (spatial relationships) सुसंगत राहतात आणि आउटपुट थेट गेमिंग आणि AR/VR च्या प्रोडक्शन पाइपलाईन्समध्ये वापरता येते. कलाकार आणि तांत्रिक दिग्दर्शकांसाठी हे महत्त्वाचे आहे कारण यामुळे महागड्या पोस्ट-प्रोसेसिंग क्लिनअपची गरज उरत नाही, ज्यामुळे 3D जनरेशन स्वीकारणे कठीण झाले होते.
जेव्हा AI संशोधनातील किरकोळ कामे करू लागते
शोधनिबंध लिहिणे हे शास्त्रज्ञांना सहसा मागे खेचत नाही. पोस्टर, तीन मिनिटांचा व्हिडिओ सारांश, ब्लॉग रूपांतरण आणि सोशल मीडिया थ्रेड्स यामुळे संपूर्ण आठवडा खर्च होतो. नवीन साधने आता केवळ एक शोधनिबंध वाचून संपूर्ण संवाद संच (communication stack) स्वयंचलितपणे तयार करू शकतात. संशोधनाच्या बाबतीत, इतर प्रणाली प्रत्यक्ष पुराव्यांसाठी साहित्य वाचतात आणि केवळ अंदाजांवर आधारित नसून, नोंदवलेल्या त्रुटींवर (documented gaps) आधारित संशोधनाच्या दिशा सुचवतात. याचा परिणाम म्हणजे प्रयोगापासून ते निष्कर्ष काढण्यापर्यंतचा कालावधी कमी होतो. पदवीचे विद्यार्थी आणि मुख्य संशोधक (principal investigators) दोघेही फॉरमॅटिंगऐवजी विचार करण्यासाठी तासनतास वाचवू शकतात.
अंदाज न लावता भूमितीच्या आधारे ऑप्टिमायझर्स निवडणे
Adam आणि Lion मधील निवड करणे हे अजूनही लॅबच्या Slack चॅनेलद्वारे प्रसारित होणाऱ्या एखाद्या परंपरेने चालत आलेल्या ज्ञानासारखे वाटते. नवीन संशोधन भूमितीय वर्गीकरण प्रणालीचा (geometric classification system) वापर करून या समस्येची पुनर्रचना करते. पुन्हा एकदा वेळखाऊ प्रक्रियेत (sweep) GPU चे तास वाया घालवण्याऐवजी, तुम्ही ऑप्टिमायझर्सची त्यांच्या भूमितीय गुणधर्मांद्वारे तुलना करू शकता आणि प्रत्येक ऑप्टिमायझर तुमच्या loss landscape सोबत कसा संवाद साधेल याचा अंदाज लावू शकता. यामुळे निवड प्रक्रिया ही केवळ एक जादू न राहता एक निदान (diagnosis) बनते. व्यावसायिकांसाठी, याचा अर्थ असा की, ऑप्टिमायझरची भूमिती आणि डेटाची भूमिती यांच्यातील विसंगतीमुळे अयशस्वी होणाऱ्या ट्रेनिंग रनची संख्या कमी होईल.
परिणाम समजून घेणारे 'वर्ल्ड मॉडेल्स'
रोबोट आपला मार्ग आखत असल्याचा एखादा रेंडर केलेला व्हिडिओ उत्कृष्ट दिसू शकतो, पण त्यातून काहीही सिद्ध होत नाही. खरी कसोटी ही आहे की, 'वर्ल्ड मॉडेल' त्याच्या कृतींचे दीर्घकालीन परिणाम वर्तवू शकते का. आता तो बॉक्स उचलल्यामुळे नंतर रोबोटचा हात कपाटाच्या मागे अडकून पडेल का? नवीन बेंचमार्क केवळ दृश्य सौंदर्याला महत्त्व न देता, मॉडेल्सना केवळ त्यांच्या causal foresight (कारणात्मक दूरदृष्टी) वर आधारित गुण देतात. हे महत्त्वाचे आहे कारण एक सुंदर सिम्युलेटर खराब झालेला सेन्सर किंवा पडलेला पॅलेट दुरुस्त करू शकत नाही. रोबोटिक्स तज्ज्ञांना अशा मूल्यमापनाची गरज आहे जे भौतिक जगातील जोखमींशी सुसंगत असेल.
GPU चा खर्च न वाढवता डिफ्यूजन चालवणे
डिफ्यूजन मॉडेल्स उत्कृष्ट चित्रे तयार करतात, परंतु त्यासाठी प्रचंड संगणकीय खर्च (compute bill) येतो. नवीन quantization तंत्रे मोठ्या डेटासेटची किंवा पूर्ण री-ट्रेनिंगची गरज न ठेवता, लहान GPU साठी हे weights कॉम्प्रेस करतात. तुम्ही थोड्या प्रमाणात अचूकतेचा (fidelity) त्याग करून स्थानिक पातळीवर (locally) चालवण्याची, विद्यमान हार्डवेअरवर अधिक कामे करण्याची किंवा प्रीमियम क्लस्टर्स भाड्याने न घेता inference करण्याची क्षमता मिळवू शकता. स्टुडिओ आणि स्वतंत्र निर्मात्यांसाठी, हे जनरेटिव्ह मीडियाचे अर्थशास्त्र बदलून टाकते. व्हिडिओ आणि इमेज जनरेशनसोबत प्रयोग करण्याचे अडथळे मोठ्या प्रमाणात कमी होतात.
मुख्य निष्कर्ष
या सर्व कामांमधील मुख्य सूत्र म्हणजे ऑपरेशनलायझेशन (operationalization). समुदाय आता अशा टप्प्यावरून पुढे गेला आहे जिथे 'मोठे म्हणजे चांगले' असे मानले जात असे. सध्या लोकप्रिय होत असलेले शोधनिबंध inference-time स्थिरता, डेटा मिक्सिंग स्ट्रॅटेजी, क्रॉस-प्लॅटफॉर्म मेमरी, edge deployment आणि पुराव्यावर आधारित शोध या गोष्टींसाठी ऑप्टिमाइझ करतात. ते मॉडेलला एका मोठ्या प्रणालीचा एक घटक मानतात, ज्यामध्ये हार्डवेअर मर्यादा, युजर इंटरफेस आणि संशोधन कार्यप्रवाह (research workflows) यांचा समावेश असतो.
जर तुम्ही उत्पादने बाजारात आणत असाल, तर संकेत स्पष्ट आहेत. शोधनिबंधातील निकषांसाठी (paper metrics) नाही, तर प्रत्यक्ष वापराच्या वास्तवासाठी (deployment reality) ऑप्टिमाइझ करा. लक्षात ठेवणारे एजंट्स आणि प्रत्यक्ष उपकरणांमध्ये बसू शकतील अशी मॉडेल्स तयार करा.
