शून्य से विज़न-लैंग्वेज मॉडल को प्रशिक्षित करना हमेशा से एक संसाधन-गहन (resource-heavy) कार्य रहा है। अधिकांश आधुनिक दृष्टिकोण डिस्टिलेशन (distillation) पर निर्भर करते हैं, जिसका अर्थ है कि आपको पहले एक शक्तिशाली टीचर मॉडल तक पहुंच की आवश्यकता होती है जो आमतौर पर उस स्टूडेंट मॉडल से बड़ा होता है जिसे आप प्रशिक्षित करने की कोशिश कर रहे हैं। आप उस टीचर को चलाने के लिए कंप्यूट, उसे डेटा खिलाने वाले पाइपलाइन को प्रबंधित करने और दो मॉडलों को सिंक में रखने के इंजीनियरिंग ओवरहेड के लिए भुगतान करते हैं। छोटी टीमों या एज हार्डवेयर के लिए मॉडल बनाने वालों के लिए, यह सेटअप एक बड़ी बाधा पैदा करता है। या तो आपको एक विशाल सेकेंडरी नेटवर्क के लिए बजट ढूंढना पड़ता है, या आप कमजोर प्रदर्शन के साथ समझौता कर लेते हैं।

विज़ुअल कॉन्ट्रास्टिव सेल्फ-डिस्टिलेशन, या VCSD, उस बाधा को पूरी तरह से हटा देता है। एक बाहरी टीचर की ओर देखने के बजाय, मॉडल खुद को सुपरवाइज करना सीखता है। यह तकनीक बड़े मॉडलों और अतिरिक्त सुपरविजन पर सामान्य निर्भरता को खत्म कर देती है, फिर भी यह बेंचमार्क स्कोर को ऊपर ले जाती है। इसका परिणाम एक ऐसा ट्रेनिंग लूप है जो अधिक सुव्यवस्थित (leaner), सस्ता और पुनरुत्पादित (reproduce) करने में आसान है।

बाहरी टीचरों का छिपा हुआ टैक्स

विज़न-लैंग्वेज की दुनिया में मानक नॉलेज डिस्टिलेशन एक परिचित पैटर्न का पालन करता है। एक बड़ा, सक्षम मॉडल सॉफ्ट टारगेट्स (soft targets), अटेंशन मैप्स (attention maps), या रीजनिंग ट्रेसेस (reasoning traces) उत्पन्न करता है। छोटा स्टूडेंट मॉडल इन आउटपुट्स की नकल करने की कोशिश करता है। विचार सही है, लेकिन कार्यान्वयन भारी है। आपको टीचर को लगातार चलाने के लिए GPUs या TPUs की आवश्यकता होती है, जो अक्सर स्टूडेंट की तुलना में बड़े बैच साइज या उच्च सटीकता (higher precision) पर चलते हैं। आपको क्यूरेटेड डेटा पेयरिंग की भी आवश्यकता होती है, और कभी-कभी ग्राउंड-ट्रुथ रीजनिंग चेन्स (ground-truth reasoning chains) जैसी विशेषाधिकार प्राप्त जानकारी की भी, जिन्हें इकट्ठा करना महंगा होता है या जो आपके लक्षित डोमेन के लिए उपलब्ध नहीं होती है।

ये आवश्यकताएं प्रयोगों में लेटेंसी (latency) बढ़ा देती हैं। ये इंफ्रास्ट्रक्चर बिलों को बढ़ा देती हैं। और वे आपके पाइपलाइन में एक नाजुक निर्भरता डालती हैं: यदि टीचर मॉडल बदल जाता है या अनुपलब्ध हो जाता है, तो आपकी ट्रेनिंग रणनीति टूट जाती है। VCSD को इसी नाजुकता को खत्म करने के लिए डिज़ाइन किया गया था।

एक सेल्फ-कंटेन्ड ट्रेनिंग लूप

VCSD के पीछे का मुख्य विचार बहुत ही सरल है। सिस्टम स्टूडेंट मॉडल का ही एक एक्सपोनेंशियल मूविंग एवरेज (Exponential Moving Average), या EMA बनाए रखता है। यह EMA एक स्थिर संदर्भ बिंदु (stable reference point) के रूप में कार्य करता है, न कि किसी बाहरी ओरेकल (oracle) के रूप में। प्रत्येक ट्रेनिंग इमेज के लिए, पाइपलाइन दो इनपुट तैयार करती है। पहला मूल इमेज है। दूसरा उसी इमेज का वह संस्करण है जिसका कंटेंट मिटा दिया गया है।

मॉडल फिर दोनों संस्करणों के अपने टोकन-लेवल रिस्पॉन्स (token-level responses) की तुलना करता है। जब विज़ुअल कंटेंट गायब हो जाता है, तो कुछ टोकन नाटकीय रूप से बदल जाते हैं। अन्य लगभग समान रहते हैं। जो टोकन बदलते हैं, वे वास्तव में वे होते हैं जो मॉडल के निर्णयों को वास्तविक विज़ुअल साक्ष्यों के साथ जोड़ रहे थे। जो टोकन स्थिर रहते हैं, वे संभवतः केवल सतही पैटर्न, सांख्यिकीय पूर्वाग्रहों (statistical biases), या लैंग्वेज प्रायर्स (language priors) पर निर्भर थे।

मिटाए गए कंटेंट के प्रति प्रतिक्रिया करने वाले टोकनों पर ध्यान केंद्रित करके, मॉडल सीखता है कि कौन सी विज़ुअल विशेषताएं वास्तव में मायने रखती हैं। यह प्रभावी रूप से खुद से पूछता है, "मैंने क्या देखना बंद कर दिया, और मेरे आउटपुट में उस बदलाव से क्या हुआ?" यही प्रश्न ट्रेनिंग सिग्नल बन जाता है। पूरी प्रक्रिया मौजूदा लूप के भीतर ही होती है। किसी दूसरे सर्वर पर बैठे मल्टी-बिलियन-पैरामीटर वाले टीचर के माध्यम से कोई सेकेंडरी फॉरवर्ड पास (forward pass) नहीं होता है।

मैकेनिज्म को डिकोड करना

यह समझने के लिए कि यह क्यों काम करता है, सोचें कि विज़न-लैंग्वेज मॉडल अक्सर कैसे व्यवहार करते हैं। एक मॉडल किसी इमेज का सही कैप्शन इसलिए दे सकता है क्योंकि वह टेक्स्ट प्रॉम्प्ट में आसपास के संदर्भ को पहचानता है, या क्योंकि उसने प्री-ट्रेनिंग के दौरान हजारों बार समान इमेज-टेक्स्ट पेयर्स देखे हैं। हो सकता है कि वह वास्तव में उस विशिष्ट ऑब्जेक्ट को न देख रहा हो जिसकी आपको परवाह है। VCSD ईमानदारी सुनिश्चित करता है।

जब कंटेंट मिटा दिया जाता है, तो मॉडल उन परिचित पैटर्न पर निर्भर होकर धोखाधड़ी नहीं कर सकता। यदि इसका उत्तर विफल हो जाता है, तो सिस्टम जान जाता है कि मूल उत्तर विज़ुअली ग्राउंडेड (visually grounded) था। यदि उत्तर वही रहता है, तो सिस्टम जान जाता है कि मॉडल गैर-विज़ुअल शॉर्टकट पर निर्भर था। मूल और मिटाई गई इमेज के बीच का अंतर सार्थक विशेषताओं के लिए एक सख्त फिल्टर बन जाता है।

यह पहले से ही जटिल स्टैक पर जोड़ा गया कोई अतिरिक्त लॉस (loss) नहीं है। यह डिस्टिलेशन टारगेट का एक नया रूप है। मॉडल अपने स्वयं के EMA टीचर से ज्ञान को एक कंसिस्टेंसी चेक (consistency check) का उपयोग करके डिस्टिल करता है, जिसके लिए आपके पास पहले से मौजूद ट्रेनिंग डेटा के अलावा और कुछ भी आवश्यक नहीं है।

आंकड़े क्या दर्शाते हैं

VCSD लेखकों ने तीन पैमानों पर Qwen3-VL मॉडलों पर इस पद्धति का परीक्षण किया, और लाभ निरंतर हैं। 2 बिलियन पैरामीटर वाले मॉडल ने 62.27 प्रतिशत से बढ़कर 67.04 प्रतिशत तक सुधार किया। 4 बिलियन पैरामीटर वाले मॉडल में 71.30 प्रतिशत से 73.16 प्रतिशत तक सुधार हुआ। 8 बिलियन पैरामीटर वाले मॉडल में 72.51 प्रतिशत से 76.26 प्रतिशत तक की छलांग लगी।

ये मामूली बढ़त नहीं हैं। 2B स्केल पर, यह लगभग पांच प्रतिशत अंक है। 8B स्केल पर, यह उछाल लगभग चार अंक है। विजन-लैंग्वेज बेंचमार्क में, जहाँ सुधार अक्सर प्रतिशत के अंशों में आते हैं, ये बदलाव संकेत देते हैं कि मॉडल न केवल अपने टेक्स्ट डिकोडर को ट्यून कर रहा है, बल्कि काफी बेहतर विजुअल ग्राउंडिंग भी सीख रहा है।

बिल्डर्स के लिए वास्तविक दुनिया पर प्रभाव

VCSD महत्वपूर्ण है क्योंकि यह डिप्लॉयमेंट की इकोनॉमिक्स को प्रभावित किए बिना ट्रेनिंग की इकोनॉमिक्स को बदल देता है।

पहला, लागत तुरंत कम हो जाती है। आपको अपने ट्रेनिंग जॉब के समानांतर एक विशाल टीचर मॉडल को प्रोविजन, लोड या रन करने की आवश्यकता नहीं है। आपका कंप्यूट बजट स्टूडेंट मॉडल और उसके EMA शैडो तक सिमट जाता है, जिसे आप पहले से ही मेंटेन कर रहे हैं।

दूसरा, डेटा पाइपलाइन सरल बनी रहती है। आपको प्रिविलेज्ड जवाबों, चेन-ऑफ-थॉट ट्रेसेस, या अन्य कठिन-से-प्राप्त सुपरविजन सिग्नल्स की आवश्यकता नहीं है। यदि आपके पास इमेज-टेक्स्ट पेयर्स हैं, तो आपके पास वह सब कुछ है जिसकी आपको आवश्यकता है। ह्यूमन रीजनिंग एनोटेशन एकत्र करने की तुलना में प्रत्येक इमेज की एक मिटाई गई कॉपी बनाना बहुत आसान है।

तीसरा, इन्फरेंस स्पीड अपरिवर्तित रहती है। VCSD जो कुछ भी करता है वह ट्रेनिंग के दौरान होता है। एक बार जब आप मॉडल को डिप्लॉय कर देते हैं, तो यह केवल एक स्टैंडर्ड Qwen3-VL चेकपॉइंट होता है। इसमें कोई अतिरिक्त ब्रांचेस, कोई ऑक्ज़िलरी हेड्स और कोई रनटाइम ओवरहेड नहीं होता है। वह जीरो-कॉस्ट डिप्लॉयमेंट प्रोफाइल इसे एज डिवाइसेस दोनों के लिए आदर्श बनाता है