ایک ویژن-لینگویج ماڈل کو شروع سے (from scratch) تربیت دینا ہمیشہ سے ایک وسائل پر مبنی (resource-heavy) عمل رہا ہے۔ زیادہ تر جدید طریقے ڈسٹلیشن (distillation) پر انحصار کرتے ہیں، جس کا مطلب ہے کہ آپ کو پہلے ایک طاقتور ٹیچر ماڈل تک رسائی کی ضرورت ہوتی ہے جو عام طور پر اس اسٹوڈنٹ ماڈل سے بڑا ہوتا ہے جسے آپ تربیت دینے کی کوشش کر رہے ہوتے ہیں۔ آپ اس ٹیچر کو چلانے کے لیے کمپیوٹ (compute) کی قیمت ادا کرتے ہیں، اسے ڈیٹا فراہم کرنے والی پائپ لائن کو مینیج کرتے ہیں، اور دو ماڈلز کو ہم آہنگ (sync) رکھنے کے انجینئرنگ اوور ہیڈ کا سامنا کرتے ہیں۔ چھوٹی ٹیموں یا ایج ہارڈ ویئر (edge hardware) کے لیے ماڈلز بنانے والوں کے لیے، یہ سیٹ اپ ایک بڑی رکاوٹ پیدا کرتا ہے۔ یا تو آپ کو ایک بڑے ثانوی نیٹ ورک کے لیے بجٹ تلاش کرنا پڑتا ہے، یا آپ کمزور کارکردگی پر سمجھوتہ کر لیتے ہیں۔
ویژول کنٹراسٹو سیلف-ڈسٹلیشن، یا VCSD، اس رکاوٹ کو مکمل طور پر ختم کر دیتا ہے۔ کسی بیرونی ٹیچر کی طرف دیکھنے کے بجائے، ماڈل خود کی نگرانی (supervise) کرنا سیکھتا ہے۔ یہ تکنیک بڑے ماڈلز اور اضافی نگرانی پر عام انحصار کو ختم کر دیتی ہے، پھر بھی یہ بینچ مارک اسکورز کو اوپر لے جاتی ہے۔ اس کا نتیجہ ایک ایسا ٹریننگ لوپ ہے جو زیادہ ہلکا (leaner)، سستا اور دوبارہ تخلیق کرنے میں آسان ہے۔
بیرونی ٹیچرز کا پوشیدہ ٹیکس
ویژن-لینگویج کی دنیا میں معیاری نالج ڈسٹلیشن ایک مانوس پیٹرن پر عمل کرتی ہے۔ ایک بڑا اور قابل ماڈل سافٹ ٹارگٹس (soft targets)، اٹینشن میپس (attention maps)، یا ریژوننگ ٹریسز (reasoning traces) تیار کرتا ہے۔ چھوٹا اسٹوڈنٹ ماڈل ان آؤٹ پٹس کی نقل کرنے کی کوشش کرتا ہے۔ خیال تو درست ہے، لیکن اس پر عمل درآمد بھاری ہے۔ آپ کو ٹیچر کو مسلسل چلانے کے لیے GPUs یا TPUs کی ضرورت ہوتی ہے، جو اکثر اسٹوڈنٹ کے مقابلے میں بڑے بیچ سائز یا زیادہ پریسیژن پر ہوتے ہیں۔ آپ کو منتخب کردہ ڈیٹا پیئرنگز (curated data pairings) کی بھی ضرورت ہوتی ہے، اور بعض اوقات ایسی خصوصی معلومات جیسے کہ گراؤنڈ-ٹروتھ ریژوننگ چینز (ground-truth reasoning chains) کی ضرورت ہوتی ہے جنہیں جمع کرنا مہنگا ہوتا ہے یا آپ کے ٹارگٹ ڈومین کے لیے دستیاب نہیں ہوتے۔
یہ ضروریات تجربات میں تاخیر (latency) کا باعث بنتی ہیں۔ یہ انفراسٹرکچر کے بلوں میں اضافہ کرتی ہیں۔ اور یہ آپ کے پائپ لائن میں ایک نازک انحصار پیدا کرتی ہیں: اگر ٹیچر ماڈل تبدیل ہو جائے یا دستیاب نہ رہے، تو آپ کی ٹریننگ حکمت عملی ٹوٹ جاتی ہے۔ VCSD کو اسی نازک پن کو ختم کرنے کے لیے ڈیزائن کیا گیا تھا۔
ایک خود مختار ٹریننگ لوپ
VCSD کے پیچھے بنیادی خیال نہایت سادہ اور خوبصورت ہے۔ سسٹم خود اسٹوڈنٹ ماڈل کا ایک ایکسپونینشل موونگ ایوریج (Exponential Moving Average)، یا EMA برقرار رکھتا ہے۔ یہ EMA ایک مستحکم ریفرنس پوائنٹ کے طور پر کام کرتا ہے، نہ کہ کسی بیرونی پیشگوئی کرنے والے (oracle) کے طور پر۔ ہر ٹریننگ امیج کے لیے، پائپ لائن دو ان پٹس تیار کرتی ہے۔ پہلا اصل امیج ہے۔ دوسرا وہی امیج ہے جس کا مواد مٹا دیا گیا ہو۔
ماڈل پھر دونوں ورژنز کے لیے اپنے ٹوکن لیول کے جوابات کا موازنہ کرتا ہے۔ جب بصری مواد غائب ہو جاتا ہے، تو کچھ ٹوکنز میں نمایاں تبدیلی آتی ہے۔ دوسرے تقریباً ویسے ہی رہتے ہیں۔ وہ ٹوکنز جو تبدیل ہوتے ہیں، وہی ہیں جو اصل میں ماڈل کے فیصلوں کو حقیقی بصری شواہد (visual evidence) کے ساتھ جوڑ رہے تھے۔ وہ ٹوکنز جو مستحکم رہتے ہیں، وہ غالباً صرف سطحی پیٹرنز، شماریاتی تعصبات (statistical biases)، یا لسانی ترجیحات (language priors) پر انحصار کر رہے تھے۔
ان ٹوکنز پر توجہ مرکوز کر کے جو مٹانے (erasure) پر ردعمل دیتے ہیں، ماڈل یہ سیکھتا ہے کہ کون سے بصری فیچرز (visual features) واقعی اہم ہیں۔ یہ مؤثر طریقے سے خود سے پوچھتا ہے، "میں نے کیا دیکھنا بند کر دیا، اور اس سے میرے آؤٹ پٹ میں کیا تبدیلی آئی؟" یہی سوال ٹریننگ سگنل بن جاتا ہے۔ یہ تمام عمل موجودہ لوپ کے اندر ہی ہوتا ہے۔ کسی دوسرے سرور پر بیٹھے اربوں پیرامیٹرز والے ٹیچر ماڈل کے ذریعے کوئی دوسرا فارورڈ پاس (forward pass) کرنے کی ضرورت نہیں ہوتی۔
میکانزم کی وضاحت
یہ سمجھنے کے لیے کہ یہ کیوں کام کرتا ہے، سوچیں کہ ویژن-لینگویج ماڈلز اکثر کیسا برتاؤ کرتے ہیں۔ ایک ماڈل کسی تصویر کا درست کیپشن اس لیے دے سکتا ہے کیونکہ وہ ٹیکسٹ پرامپٹ میں موجود ارد گرد کے سیاق و سباق کو پہچانتا ہے، یا اس لیے کہ اس نے پری ٹریننگ کے دوران ہزاروں بار اسی طرح کے امیج-ٹیکسٹ پیئرز دیکھے ہوتے ہیں۔ ہو سکتا ہے کہ وہ اصل میں اس مخصوص چیز کو نہ دیکھ رہا ہو جس کی آپ کو پرواہ ہے۔ VCSD ایمانداری پر مجبور کرتا ہے۔
جب مواد مٹا دیا جاتا ہے، تو ماڈل ان مانوس پیٹرنز پر انحصار کر کے دھوکہ دہی نہیں کر سکتا۔ اگر اس کا جواب گر جاتا ہے، تو سسٹم جان لیتا ہے کہ اصل جواب بصری طور پر مستحکم (visually grounded) تھا۔ اگر جواب وہی رہتا ہے، تو سسٹم جان لیتا ہے کہ ماڈل غیر بصری شارٹ کٹس (non-visual shortcuts) پر انحصار کر رہا تھا۔ اصل اور مٹائی گئی تصویر کے درمیان فرق بامعنی فیچرز کے لیے ایک سخت فلٹر بن جاتا ہے۔
یہ پہلے سے موجود پیچیدہ ڈھانچے پر لگایا گیا کوئی اضافی لاس (loss) نہیں ہے۔ یہ ڈسٹلیشن کے ہدف کی ایک نئی تشکیل ہے۔ ماڈل اپنے EMA ٹیچر سے نالج ڈسٹل کرتا ہے، جس کے لیے ایک کنسسٹنسی چیک (consistency check) استعمال ہوتا ہے جسے آپ کے پاس پہلے سے موجود ٹریننگ ڈیٹا کے علاوہ کسی اور چیز کی ضرورت نہیں ہوتی۔
اعداد و شمار کیا ظاہر کرتے ہیں
VCSD کے مصنفین نے تین پیمانوں پر Qwen3-VL ماڈلز پر اس طریقے کا تجربہ کیا، اور نتائج مستقل ہیں۔ 2 بلین پیرامیٹر والا ماڈل 62.27 فیصد سے بڑھ کر 67.04 فیصد ہو گیا۔ 4 بلین پیرامیٹر والا ماڈل 71.30 فیصد سے بہتر ہو کر 73.16 فیصد ہو گیا۔ 8 بلین پیرامیٹر والا ماڈل 72.51 فیصد سے بڑھ کر 76.26 فیصد تک پہنچ گیا۔
These are not marginal bumps. At the 2B scale, that is nearly five percentage points. At the 8B scale, the jump is almost four points. In vision-language benchmarks, where improvements often come in fractions of a percent, these shifts signal that the model is learning substantially better visual grounding, not just tuning its text decoder.
Real-World Impact for Builders
VCSD matters because it changes the economics of training without touching the economics of deployment.
First, cost falls immediately. You do not need to provision, load, or run a massive teacher model in parallel with your training job. Your compute budget shrinks to the student model and its EMA shadow, which you are already maintaining.
Second, the data pipeline stays simple. You do not need privileged answers, chain-of-thought traces, or other hard-to-source supervision signals. If you have image-text pairs, you have everything you need. An erased copy of each image is trivial to generate compared to collecting human reasoning annotations.
Third, inference speed remains unchanged. Everything VCSD does happens during training. Once you deploy the model, it is just a standard Qwen3-VL checkpoint. There are no extra branches, no auxiliary heads, and no runtime overhead. That zero-cost deployment profile makes it ideal for both edge devices
