آموزش یک مدل بینایی-زبان از صفر همیشه عملیاتی سنگین از نظر منابع بوده است. اکثر رویکردهای مدرن بر تقطیر (distillation) تکیه دارند، به این معنی که ابتدا باید به یک مدل معلم (teacher model) قدرتمند دسترسی داشته باشید که معمولاً بزرگ‌تر از مدل شاگرد (student) است که قصد آموزش آن را دارید. شما هزینه محاسبات برای اجرای آن معلم، مدیریت خط لوله‌ای که داده‌ها را به آن می‌رساند و رسیدگی به هزینه‌های مهندسی برای همگام‌سازی دو مدل را می‌پردازید. برای تیم‌های کوچک‌تر یا هر کسی که مدل‌هایی برای سخت‌افزارهای لبه (edge hardware) می‌سازد، این ساختار یک سقف محدودکننده ایجاد می‌کند. یا باید بودجه‌ای برای یک شبکه ثانویه عظیم پیدا کنید، یا به عملکرد ضعیف‌تر رضایت دهید.

تقطیر خود-تقابلی بینایی یا VCSD، این سقف را به‌طور کامل از میان برمی‌دارد. مدل به جای نگاه کردن به یک معلم خارجی، یاد می‌گیرد که خود را نظارت کند. این تکنیک وابستگی معمول به مدل‌های بزرگ‌تر و نظارت اضافی را حذف می‌کند، اما همچنان امتیازات بنچمارک را بالا می‌برد. نتیجه، یک حلقه آموزشی است که سبک‌تر، ارزان‌تر و بازتولید آن آسان‌تر است.

مالیات پنهان معلمان خارجی

تقطیر دانش استاندارد در دنیای بینایی-زبان از الگوی آشنایی پیروی می‌کند. یک مدل بزرگ و توانمند، اهداف نرم (soft targets)، نقشه‌های توجه (attention maps) یا ردپاهای استدلال (reasoning traces) تولید می‌کند. مدل شاگرد کوچک‌تر سعی می‌کند از این خروجی‌ها تقلید کند. ایده درست است، اما اجرا سنگین است. شما به GPUها یا TPUهایی نیاز دارید که معلم را به‌طور مداوم، اغلب با اندازه دسته (batch size) بزرگ‌تر یا دقت بالاتر از شاگرد، در حال اجرا نگه دارند. همچنین به جفت‌داده‌های منتخب و گاهی اوقات اطلاعات ویژه مانند زنجیره‌های استدلال واقعیت (ground-truth reasoning chains) نیاز دارید که جمع‌آوری آن‌ها گران است یا برای دامنه هدف شما در دسترس نیست.

این الزامات باعث ایجاد تأخیر در آزمایش‌ها می‌شود. آن‌ها هزینه‌های زیرساختی را متورم می‌کنند. و یک وابستگی شکننده را در خط لوله شما ایجاد می‌کنند: اگر مدل معلم تغییر کند یا در دسترس نباشد، استراتژی آموزشی شما از هم می‌پاشد. VCSD برای از بین بردن این شکنندگی طراحی شده است.

یک حلقه آموزشی خودکفا

ایده اصلی پشت VCSD به شکلی ظریف، ساده است. سیستم یک میانگین متحرک نمایی (EMA) از خودِ مدل شاگرد را حفظ می‌کند. این EMA به عنوان یک نقطه مرجع پایدار عمل می‌کند، نه یک پیشگوی خارجی. برای هر تصویر آموزشی، خط لوله دو ورودی تولید می‌کند. اولی تصویر اصلی است. دومی همان تصویر است که محتوای آن پاک شده است.

سپس مدل پاسخ‌های خود را در سطح توکن (token-level) با هر دو نسخه مقایسه می‌کند. وقتی محتوای بصری ناپدید می‌شود، برخی توکن‌ها به‌شدت تغییر می‌کنند. برخی دیگر تقریباً ثابت می‌مانند. توکن‌هایی که تغییر می‌کنند، همان‌هایی هستند که در واقع تصمیمات مدل را بر پایه شواهد بصری واقعی استوار (grounding) می‌کردند. توکن‌هایی که پایدار می‌مانند، احتمالاً تنها به الگوهای سطحی، سوگیری‌های آماری یا اولویت‌های زبانی (language priors) متکی بوده‌اند.

با تمرکز بر توکن‌هایی که به حذف محتوا واکنش نشان دادند، مدل یاد می‌گیرد که کدام ویژگی‌های بصری واقعاً اهمیت دارند. مدل عملاً از خود می‌پرسد: «چه چیزی را دیگر نمی‌بینم و این تغییر چه تأثیری در خروجی من داشت؟» این سوال به سیگنال آموزشی تبدیل می‌شود. تمام این فرآیند در داخل همان حلقه موجود اتفاق می‌افتد. هیچ گذر مستقیم (forward pass) ثانویه‌ای از طریق یک معلم با میلیاردها پارامتر که روی سرور دیگری قرار دارد، وجود ندارد.

رمزگشایی از مکانیسم

برای درک اینکه چرا این روش کار می‌کند، به نحوه رفتار مدل‌های بینایی-زبان فکر کنید. یک مدل ممکن است تصویر را به‌درستی شرح (caption) دهد، چون بافتار اطراف را در دستور متنی (text prompt) تشخیص می‌دهد، یا چون هزاران بار جفت‌های تصویر-متن مشابه را در طول پیش‌آموزش (pre-training) دیده است. ممکن است واقعاً به شیء خاصی که مد نظر شماست نگاه نکند. VCSD صداقت را تحمیل می‌کند.

وقتی محتوا پاک می‌شود، مدل دیگر نمی‌تواند با تکیه بر آن الگوهای آشنا تقلب کند. اگر پاسخ آن فرو بپاشد، سیستم می‌داند که پاسخ اصلی بر پایه بصری استوار بوده است. اگر پاسخ ثابت بماند، سیستم می‌داند که مدل به میان‌برهای غیربصری متکی بوده است. تضاد بین تصویر اصلی و تصویر پاک‌شده، به یک فیلتر سخت برای ویژگی‌های معنادار تبدیل می‌شود.

این یک تابع زیان (loss) اضافی نیست که به یک ساختار پیچیده قبلاً اضافه شده باشد؛ بلکه بازتعریف هدف تقطیر است. مدل دانش را از معلم EMA خود با استفاده از یک بررسی سازگاری (consistency check) استخراج می‌کند که به چیزی جز داده‌های آموزشی که از قبل دارید، نیاز ندارد.

آنچه اعداد نشان می‌دهند

نویسندگان VCSD این روش را روی مدل‌های Qwen3-VL در سه مقیاس آزمایش کردند و نتایج به‌دست‌آمده همسو هستند. مدل ۲ میلیارد پارامتری از ۶۲.۲۷ درصد به ۶۷.۰۴ درصد رسید. مدل ۴ میلیارد پارامتری از ۷۱.۳۰ درصد به ۷۳.۱۶ درصد بهبود یافت. و مدل ۸ میلیارد پارامتری از ۷۲.۵۱ درصد به ۷۶.۲۶ درصد جهش کرد.

These are not marginal bumps. At the 2B scale, that is nearly five percentage points. At the 8B scale, the jump is almost four points. In vision-language benchmarks, where improvements often come in fractions of a percent, these shifts signal that the model is learning substantially better visual grounding, not just tuning its text decoder.

Real-World Impact for Builders

VCSD matters because it changes the economics of training without touching the economics of deployment.

First, cost falls immediately. You do not need to provision, load, or run a massive teacher model in parallel with your training job. Your compute budget shrinks to the student model and its EMA shadow, which you are already maintaining.

Second, the data pipeline stays simple. You do not need privileged answers, chain-of-thought traces, or other hard-to-source supervision signals. If you have image-text pairs, you have everything you need. An erased copy of each image is trivial to generate compared to collecting human reasoning annotations.

Third, inference speed remains unchanged. Everything VCSD does happens during training. Once you deploy the model, it is just a standard Qwen3-VL checkpoint. There are no extra branches, no auxiliary heads, and no runtime overhead. That zero-cost deployment profile makes it ideal for both edge devices