ஒரு பார்வை-மொழி மாதிரியை (vision-language model) ஆரம்பத்திலிருந்து பயிற்றுவிப்பது எப்போதும் அதிக வளங்கள் தேவைப்படும் ஒரு செயலாகும். பெரும்பாலான நவீன அணுகுமுறைகள் 'distillation' முறையைச் சார்ந்தே உள்ளன, அதாவது நீங்கள் பயிற்றுவிக்க முயற்சிக்கும் மாணவர் மாதிரியை (student model) விட பொதுவாகப் பெரியதாக இருக்கும் ஒரு சக்திவாய்ந்த ஆசிரியர் மாதிரியை (teacher model) முதலில் அணுக வேண்டியிருக்கும். அந்த ஆசிரியர் மாதிரியை இயக்குவதற்கான கணக்கீட்டுத் திறனுக்காகவும் (compute), அதற்குத் தரவுகளை வழங்கும் குழாயை (pipeline) நிர்வகிக்கவும், இரண்டு மாதிரிகளையும் ஒருங்கிணைந்து வைத்திருப்பதற்கான பொறியியல் கூடுதல் சுமைகளையும் நீங்கள் ஏற்க வேண்டியிருக்கும். சிறிய குழுக்களுக்கோ அல்லது எட்ஜ் ஹார்டுவேருக்கான (edge hardware) மாதிரிகளை உருவாக்கும் எவருக்கோ, இந்த அமைப்பு ஒரு கடுமையான வரம்பை உருவாக்குகிறது. நீங்கள் ஒரு பிரம்மாண்டமான இரண்டாம் நிலை நெட்வொர்க்கிற்கான பட்ஜெட்டைத் தேட வேண்டும் அல்லது பலவீனமான செயல்திறனோடு சமரசம் செய்து கொள்ள வேண்டும்.
விஷுவல் கான்ட்ராஸ்டிவ் செல்ஃப்-டிஸ்டிலேஷன் (Visual Contrastive Self-Distillation), அல்லது VCSD, அந்தத் தடையை முழுமையாக நீக்குகிறது. ஒரு வெளிப்புற ஆசிரியர் மாதிரியைத் தேடுவதற்குப் பதிலாக, இந்த மாதிரி தானாகவே தன்னை மேற்பார்வை செய்யக் கற்றுக்கொள்கிறது. இந்த நுட்பம் பெரிய மாதிரிகள் மற்றும் கூடுதல் மேற்பார்வை மீதான வழக்கமான சார்புநிலையை நீக்குகிறது, அதே சமயம் பெஞ்ச்மார்க் மதிப்பெண்களை உயர்த்துகிறது. இதன் விளைவாகக் கிடைக்கும் பயிற்சிச் சுழற்சி (training loop) மிகவும் எளிமையானது, மலிவானது மற்றும் மீண்டும் உருவாக்குவதற்கு எளிதானது.
வெளிப்புற ஆசிரியர்களின் மறைமுகச் சுமை
பார்வை-மொழி உலகில் வழக்கமான அறிவு வடிகட்டுதல் (knowledge distillation) ஒரு தெரிந்த முறையைப் பின்பற்றுகிறது. ஒரு பெரிய, திறமையான மாதிரி 'soft targets', 'attention maps' அல்லது 'reasoning traces'-களை உருவாக்குகிறது. சிறிய மாணவர் மாதிரி இந்த வெளியீடுகளைப் பின்பற்ற முயல்கிறது. இந்த யோசனை சரியானதுதான், ஆனால் அதன் செயல்பாட்டு முறை கடினமானது. ஆசிரியர் மாதிரியைத் தொடர்ந்து இயக்குவதற்கு உங்களுக்கு GPUs அல்லது TPUs தேவைப்படும், பெரும்பாலும் மாணவர் மாதிரியை விட பெரிய பேட்ச் அளவு (batch size) அல்லது உயர் துல்லியத்தில் இது இயங்க வேண்டும். மேலும், நீங்கள் க்யூரேட் செய்யப்பட்ட தரவு இணைகளையும் (curated data pairings), சில நேரங்களில் உங்கள் இலக்கு களத்திற்கு (target domain) கிடைக்காத அல்லது சேகரிக்க அதிக செலவாகும் 'ground-truth reasoning chains' போன்ற சிறப்புத் தகவல்களையும் வைத்திருக்க வேண்டியிருக்கும்.
இந்தத் தேவைகள் சோதனைகளில் தாமதத்தை (latency) ஏற்படுத்துகின்றன. அவை உள்கட்டமைப்புச் செலவுகளை (infrastructure bills) அதிகரிக்கின்றன. மேலும் அவை உங்கள் குழாயில் ஒரு உடையக்கூடிய சார்புநிலையை (brittle dependency) உருவாக்குகின்றன: ஆசிரியர் மாதிரி மாறினால் அல்லது கிடைக்காமல் போனால், உங்கள் பயிற்சி உத்தி முறிந்துவிடும். அந்தத் தன்மையற்ற தன்மையை நீக்குவதற்காகவே VCSD வடிவமைக்கப்பட்டது.
ஒரு சுயக்கட்டுப்பாட்டு பயிற்சிச் சுழற்சி
VCSD-ன் பின்னணியில் உள்ள முக்கியக் கருத்து மிகவும் எளிமையானது. இந்த அமைப்பு மாணவர் மாதிரியின் 'Exponential Moving Average' (EMA)-வை பராமரிக்கிறது. இந்த EMA ஒரு நிலையான குறிப்புப் புள்ளியாகச் செயல்படுகிறதே தவிர, ஒரு வெளிப்புற oracle போல அல்ல. ஒவ்வொரு பயிற்சிப் படத்திற்கும், இந்த குழாய் இரண்டு உள்ளீடுகளை உருவாக்குகிறது. முதலாவது அசல் படம். இரண்டாவது அதே படம், ஆனால் அதன் உள்ளடக்கங்கள் நீக்கப்பட்ட நிலையில் இருக்கும்.
மாதிரி பின்னர் அதன் சொந்த டோக்கன்-நிலை (token-level) பதில்களை இந்த இரண்டு பதிப்புகளுடனும் ஒப்பிடுகிறது. காட்சி உள்ளடக்கம் மறையும் போது, சில டோக்கன்கள் வியத்தகு முறையில் மாறுகின்றன. மற்றவை ஏறக்குறைய அப்படியே இருக்கின்றன. மாறக்கூடிய டோக்கன்கள் மட்டுமே மாதிரியின் முடிவுகளை உண்மையான காட்சி ஆதாரங்களுடன் (visual evidence) இணைப்பதாக உள்ளன. நிலையாக இருக்கும் டோக்கன்கள் பெரும்பாலும் மேலோட்டமான வடிவங்கள், புள்ளிவிவர சார்புகள் அல்லது மொழி முன்னுரிமைகளை (language priors) மட்டுமே சார்ந்து இருந்திருக்கலாம்.
நீக்கத்திற்குப் பதிலளிக்கும் டோக்கன்களைக் கண்டறிவதன் மூலம், எந்தக் காட்சி அம்சங்கள் உண்மையாக முக்கியத்துவம் வாய்ந்தவை என்பதை மாதிரி கற்றுக்கொள்கிறது. அது தனக்குள்ளேயே, "நான் எதைப் பார்ப்பதை நிறுத்தினேன், அது எனது வெளியீட்டில் என்ன மாற்றத்தை ஏற்படுத்தியது?" என்று கேட்கிறது. அந்தத் தேடலே பயிற்சி சமிக்ஞையாக (training signal) மாறுகிறது. இந்த முழுச் செயல்முறையும் ஏற்கனவே உள்ள சுழற்சியிற்குள்ளேயே நடக்கிறது. மற்றொரு சர்வரில் அமர்ந்திருக்கும் பல பில்லியன் அளவுருக்கள் கொண்ட ஆசிரியர் மாதிரியின் மூலம் மீண்டும் ஒருமுறை தரவுகளைச் செலுத்த வேண்டிய அவசியம் இல்லை.
செயல்பாட்டைப் புரிந்துகொள்ளுதல்
இது ஏன் வேலை செய்கிறது என்பதைப் புரிந்துகொள்ள, பார்வை-மொழி மாதிரிகள் பெரும்பாலும் எவ்வாறு செயல்படுகின்றன என்பதைச் சிந்தித்துப் பாருங்கள். ஒரு மாதிரி ஒரு படத்தின் விளக்கத்தை (caption) சரியாகக் கூறலாம், ஏனெனில் அது உரைத் தூண்டுதலில் (text prompt) உள்ள சூழலை அடையாளம் கண்டுள்ளது அல்லது முன்-பயிற்சியின் போது ஆயிரக்கணக்கான முறை இதே போன்ற படம்-உரை இணைகளைக் கண்டுள்ளது. அது நீங்கள் கவனிக்கும் குறிப்பிட்ட பொருளை உண்மையில் பார்க்காமல் கூட இருக்கலாம். VCSD நேர்மையை வலியுறுத்துகிறது.
உள்ளடக்கம் நீக்கப்படும்போது, அந்தப் பழக்கப்பட்ட முறைகளைச் சார்ந்து மாதிரி ஏமாற்ற முடியாது. அதன் பதில் தவறாகிறது என்றால், அசல் பதில் காட்சி ரீதியாகச் சரியாக இருந்ததை அமைப்பு உணர்ந்து கொள்ளும். பதில் அப்படியே இருந்தால், மாதிரி காட்சி அல்லாத குறுக்குவழிகளைச் சார்ந்து இருந்தது என்பதை அமைப்பு உணர்ந்து கொள்ளும். அசல் மற்றும் நீக்கப்பட்ட படத்திற்கு இடையிலான இந்த வேறுபாடு, அர்த்தமுள்ள அம்சங்களுக்கான ஒரு கடினமான வடிகட்டியாக (hard filter) மாறுகிறது.
இது ஏற்கனவே உள்ள சிக்கலான அமைப்பில் இணைக்கப்படும் கூடுதல் இழப்பு (loss) அல்ல. இது வடிகட்டுதல் இலக்கின் (distillation target) மறுவடிவமைப்பு ஆகும். உங்களிடம் ஏற்கனவே உள்ள பயிற்சித் தரவை மட்டுமே பயன்படுத்தி, ஒரு நிலைத்தன்மை சரிபார்ப்பு (consistency check) மூலம் மாதிரி தனது சொந்த EMA ஆசிரியர் மாதிரியிடமிருந்து அறிவை வடிகட்டுகிறது.
புள்ளிவிவரங்கள் என்ன காட்டுகின்றன
VCSD ஆசிரியர்கள் இந்த முறையை மூன்று அளவுகளில் Qwen3-VL மாதிரிகளில் சோதித்தனர், அதன் முடிவுகள் சீராக உள்ளன. 2 பில்லியன் அளவுருக்கள் கொண்ட மாதிரி 62.27 சதவீதத்திலிருந்து 67.04 சதவீதமாக உயர்ந்தது. 4 பில்லியன் அளவுருக்கள் கொண்ட மாதிரி 71.30 சதவீதத்திலிருந்து 73.16 சதவீதமாக முன்னேறியது. 8 பில்லியன் அளவுருக்கள் கொண்ட மாதிரி 72.51 சதவீதத்திலிருந்து 76.26 சதவீதமாகப் பாய்ந்தது.
These are not marginal bumps. At the 2B scale, that is nearly five percentage points. At the 8B scale, the jump is almost four points. In vision-language benchmarks, where improvements often come in fractions of a percent, these shifts signal that the model is learning substantially better visual grounding, not just tuning its text decoder.
Real-World Impact for Builders
VCSD matters because it changes the economics of training without touching the economics of deployment.
First, cost falls immediately. You do not need to provision, load, or run a massive teacher model in parallel with your training job. Your compute budget shrinks to the student model and its EMA shadow, which you are already maintaining.
Second, the data pipeline stays simple. You do not need privileged answers, chain-of-thought traces, or other hard-to-source supervision signals. If you have image-text pairs, you have everything you need. An erased copy of each image is trivial to generate compared to collecting human reasoning annotations.
Third, inference speed remains unchanged. Everything VCSD does happens during training. Once you deploy the model, it is just a standard Qwen3-VL checkpoint. There are no extra branches, no auxiliary heads, and no runtime overhead. That zero-cost deployment profile makes it ideal for both edge devices
