शून्यापासून व्हिजन-लँग्वेज मॉडेल प्रशिक्षित करणे ही नेहमीच एक संसाधन-केंद्रित (resource-heavy) प्रक्रिया राहिली आहे. बहुतेक आधुनिक दृष्टिकोन डिस्टिलेशनवर (distillation) अवलंबून असतात, ज्याचा अर्थ असा की तुम्हाला प्रथम एका शक्तिशाली 'टीचर मॉडेल'ची (teacher model) आवश्यकता असते, जे सहसा तुम्ही प्रशिक्षित करण्याचा प्रयत्न करत असलेल्या 'स्टुडंट मॉडेल'पेक्षा (student model) मोठे असते. तुम्हाला ते टीचर मॉडेल चालवण्यासाठी लागणाऱ्या कम्प्युटसाठी, त्याला डेटा पुरवणाऱ्या पाइपलाइनचे व्यवस्थापन करण्यासाठी आणि दोन मॉडेल्स एकमेकांशी सुसंगत ठेवण्यासाठी लागणाऱ्या इंजिनिअरिंग ओव्हरहेडसाठी खर्च करावा लागतो. लहान टीम्ससाठी किंवा एज हार्डवेअरसाठी (edge hardware) मॉडेल्स तयार करणाऱ्यांसाठी, ही रचना एक मोठी मर्यादा (hard ceiling) निर्माण करते. एकतर तुम्हाला एका प्रचंड मोठ्या दुय्यम नेटवर्कसाठी बजेट शोधावे लागते, किंवा तुम्हाला कमी कामगिरीशी तडजोड करावी लागते.

व्हिज्युअल कॉन्ट्रास्टिव्ह सेल्फ-डिस्टिलेशन (Visual Contrastive Self-Distillation) किंवा VCSD, ही मर्यादा पूर्णपणे काढून टाकते. बाह्य टीचरकडे पाहण्याऐवजी, मॉडेल स्वतःवरच देखरेख (supervise) करण्यास शिकते. ही पद्धत मोठ्या मॉडेल्सवरील आणि अतिरिक्त देखरेखीवरील नेहमीची अवलंबित्व काढून टाकते, तरीही ती बेंचमार्क स्कोअर वाढवते. याचा परिणाम म्हणजे एक असा ट्रेनिंग लूप जो अधिक सुटसुटीत, स्वस्त आणि पुनरुत्पादित (reproduce) करण्यास सोपा आहे.

बाह्य टीचरचा छुपा कर (The Hidden Tax of External Teachers)

व्हिजन-लँग्वेजच्या जगात मानक नॉलेज डिस्टिलेशन (standard knowledge distillation) एका परिचित पद्धतीचे अनुसरण करते. एक मोठे, सक्षम मॉडेल सॉफ्ट टारगेट्स (soft targets), अटेंशन मॅप्स (attention maps) किंवा रिझनिंग ट्रेसेस (reasoning traces) तयार करते. लहान स्टुडंट मॉडेल या आउटपुट्सची नक्कल करण्याचा प्रयत्न करते. ही कल्पना योग्य आहे, पण अंमलबजावणी जड आहे. तुम्हाला टीचर मॉडेल सतत चालवण्यासाठी GPUs किंवा TPUs लागतात, जे सहसा स्टुडंट मॉडेलपेक्षा मोठ्या बॅच साईजवर किंवा उच्च अचूकतेवर (higher precision) चालवावे लागतात. तुम्हाला क्युरेटेड डेटा पेअरिंगची (curated data pairings) देखील आवश्यकता असते आणि कधीकधी ग्राउंड-ट्रुथ रिझनिंग चेन्ससारखी विशेष माहिती लागते, जी गोळा करणे महाग असते किंवा तुमच्या टार्गेट डोमेनसाठी उपलब्ध नसते.

या आवश्यकता प्रयोगांमध्ये विलंब (latency) निर्माण करतात. यामुळे इन्फ्रास्ट्रक्चरचे बिल वाढते. आणि ते तुमच्या पाइपलाइनमध्ये एक नाजूक अवलंबित्व निर्माण करतात: जर टीचर मॉडेल बदलले किंवा उपलब्ध नसेल, तर तुमची ट्रेनिंग स्ट्रॅटेजी कोलमडते. ही नाजूकता दूर करण्यासाठीच VCSD डिझाइन करण्यात आले आहे.

एक स्वयंपूर्ण ट्रेनिंग लूप (A Self-Contained Training Loop)

VCSD च्या मागे असलेली मूळ कल्पना अत्यंत सोपी आहे. ही प्रणाली स्वतः स्टुडंट मॉडेलचा 'एक्स्पोनेंशियल मूव्हिंग एव्हरेज' (Exponential Moving Average - EMA) राखते. हा EMA बाह्य ओरेकल (oracle) म्हणून नाही, तर एक स्थिर संदर्भ बिंदू (stable reference point) म्हणून काम करतो. प्रत्येक ट्रेनिंग इमेजसाठी, पाइपलाइन दोन इनपुट्स तयार करते. पहिले म्हणजे मूळ इमेज. दुसरे म्हणजे त्यातील कंटेंट पुसून टाकलेली तीच इमेज.

त्यानंतर मॉडेल दोन्ही आवृत्त्यांशी स्वतःच्या टोकन-स्तरीय (token-level) प्रतिसादांची तुलना करते. जेव्हा व्हिज्युअल कंटेंट गायब होतो, तेव्हा काही टोकन्समध्ये मोठी बदल होते. इतर काही साधारणपणे सारखेच राहतात. जे टोकन्स बदलतात, ते प्रत्यक्षात मॉडेलच्या निर्णयांना खऱ्या व्हिज्युअल पुराव्यांवर आधारित (grounding) करत होते. जे टोकन्स स्थिर राहतात, ते बहुधा केवळ वरवरचे पॅटर्न, सांख्यिकीय पूर्वग्रह (statistical biases) किंवा लँग्वेज प्रायर्सवर (language priors) अवलंबून होते.

मजकूर पुसून टाकल्यावर ज्या टोकन्सनी प्रतिक्रिया दिली, त्यावर लक्ष केंद्रित करून मॉडेलला समजते की कोणते व्हिज्युअल फीचर्स खरोखर महत्त्वाचे आहेत. ते प्रभावीपणे स्वतःला विचारते, “मी काय पाहणे थांबवले, आणि त्यामुळे माझ्या आउटपुटमध्ये काय बदल झाला?” तोच प्रश्न ट्रेनिंग सिग्नल बनतो. ही संपूर्ण प्रक्रिया सध्याच्या लूपच्या आतच घडते. दुसऱ्या सर्व्हरवर बसलेल्या अब्जावधी पॅरामीटर्सच्या टीचर मॉडेलद्वारे कोणताही दुय्यम फॉरवर्ड पास (forward pass) करण्याची गरज नसते.

यंत्रणा समजून घेणे (Decoding the Mechanism)

हे का काम करते हे समजून घेण्यासाठी, व्हिजन-लँग्वेज मॉडेल्स सहसा कसे वागतात याचा विचार करा. एखादे मॉडेल इमेजचे कॅप्शन योग्यरित्या देऊ शकते कारण ते टेक्स्ट प्रॉम्प्टमधील सभोवतालचा संदर्भ ओळखते, किंवा प्री-ट्रेनिंग दरम्यान त्याने हजारो वेळा अशाच प्रकारचे इमेज-टेक्स्ट पेअर्स पाहिले असतात. ते कदाचित तुम्ही ज्या विशिष्ट वस्तूवर लक्ष केंद्रित करत आहात, त्याकडे प्रत्यक्षात पाहत नसेल. VCSD प्रामाणिकपणाला भाग पाडते.

जेव्हा कंटेंट पुसून टाकला जातो, तेव्हा मॉडेल त्या परिचित पॅटर्नचा आधार घेऊन फसवणूक करू शकत नाही. जर त्याचे उत्तर चुकल, तर सिस्टमला समजते की मूळ उत्तर व्हिज्युअली ग्राउंडेड (visually grounded) होते. जर उत्तर तेच राहिले, तर सिस्टमला समजते की मॉडेल नॉन-व्हिज्युअल शॉर्टकटवर अवलंबून होते. मूळ इमेज आणि पुसलेली इमेज यातील फरक अर्थपूर्ण फीचर्ससाठी एक कडक फिल्टर (hard filter) बनतो.

हे आधीच जटिल असलेल्या स्टॅकवर जोडलेले अतिरिक्त 'लॉस' (loss) नाही. हे डिस्टिलेशन टार्गेटचे पुनर्रचना (re-framing) आहे. मॉडेल त्याच्या स्वतःच्या EMA टीचरकडून ज्ञान मिळवते, ज्यासाठी केवळ तुमच्याकडे असलेल्या ट्रेनिंग डेटाव्यतिरिक्त इतर कशाचीही गरज नसते.

आकडेवारी काय दर्शवते (What the Numbers Show)

VCSD लेखकांनी तीन वेगवेगळ्या स्केलवर Qwen3-VL मॉडेल्सवर या पद्धतीची चाचणी घेतली आणि त्यातील सुधारणा सातत्यपूर्ण आहेत. २ बिलियन पॅरामीटर मॉडेल ६२.२७ टक्क्यांवरून ६७.०४ टक्क्यांवर गेले. ४ बिलियन पॅरामीटर मॉडेल ७१.३० टक्क्यांवरून ७३.१६ टक्क्यांपर्यंत सुधारले. ८ बिलियन पॅरामीटर मॉडेल ७२.५१ टक्क्यांवरून ७६.२६ टक्क्यांपर्यंत झेपले.

हे केवळ किरकोळ बदल नाहीत. 2B स्केलवर, ती वाढ जवळपास पाच टक्क्यांच्या जवळ आहे. 8B स्केलवर, ही वाढ जवळपास चार गुणांची आहे. व्हिजन-लँग्वेज बेंचमार्क्समध्ये, जिथे सुधारणा सहसा एक टक्क्याच्या काही अंशात असतात, तिथे हे बदल सूचित करतात की मॉडेल केवळ त्याच्या टेक्स्ट डिकोडरला ट्यून करत नसून, ते अधिक चांगल्या प्रकारे व्हिज्युअल ग्राउंडिंग शिकत आहे.

बिल्डर्ससाठी वास्तविक जगातील प्रभाव

VCSD महत्त्वाचे आहे कारण ते डिप्लॉयमेंटच्या अर्थशास्त्राला धक्का न लावता प्रशिक्षणाचे अर्थशास्त्र बदलते.

पहिले म्हणजे, खर्च लगेच कमी होतो. तुम्हाला तुमच्या ट्रेनिंग जॉबसोबत समांतरपणे एखादे मोठे टीचर मॉडेल प्रोव्हिजन, लोड किंवा रन करण्याची गरज पडत नाही. तुमचे कम्प्युट बजेट केवळ स्टुडंट मॉडेल आणि त्याच्या EMA शॅडोपर्यंत मर्यादित होते, जे तुम्ही आधीच मेंटेन करत असता.

दुसरे म्हणजे, डेटा पाइपलाइन साधी राहते. तुम्हाला प्रिव्हिलेज्ड आन्सर, चेन-ऑफ-थॉट ट्रेसेस किंवा इतर कठीण सुपरव्हिजन सिग्नल्सची गरज नसते. जर तुमच्याकडे इमेज-टेक्स्ट पेअर्स असतील, तर तुमच्याकडे आवश्यक असलेले सर्व काही आहे. मानवी तर्कसंगत अ‍ॅनोटेशन्स गोळा करण्याच्या तुलनेत प्रत्येक इमेजची इरेस्ड कॉपी तयार करणे अत्यंत सोपे आहे.

तिसरे म्हणजे, इन्फरन्स स्पीडमध्ये कोणताही बदल होत नाही. VCSD द्वारे केल्या जाणाऱ्या सर्व गोष्टी ट्रेनिंग दरम्यान घडतात. एकदा तुम्ही मॉडेल डिप्लॉय केले की, ते फक्त एक स्टँडर्ड Qwen3-VL चेकपॉइंट असते. त्यात कोणतेही अतिरिक्त ब्रँचेस, कोणतेही ऑक्सिलरी हेड्स किंवा रनटाइम ओव्हरहेड नसतो. ते झिरो-कॉस्ट डिप्लॉयमेंट प्रोफाइल त्याला एज डिवाइसेससाठी देखील आदर्श बनवते.