Việc huấn luyện một mô hình thị giác-ngôn ngữ (vision-language model) từ đầu luôn là một hoạt động tiêu tốn nhiều tài nguyên. Hầu hết các phương pháp hiện đại đều dựa vào kỹ thuật chưng cất (distillation), điều này có nghĩa là trước tiên bạn cần có quyền truy cập vào một mô hình giáo viên (teacher model) mạnh mẽ, thường lớn hơn mô hình học sinh (student model) mà bạn đang cố gắng huấn luyện. Bạn phải trả chi phí tính toán để chạy mô hình giáo viên đó, quản lý quy trình cung cấp dữ liệu cho nó và xử lý các chi phí kỹ thuật để giữ cho hai mô hình đồng bộ với nhau. Đối với các nhóm nhỏ hơn hoặc bất kỳ ai đang xây dựng các mô hình cho phần cứng cạnh (edge hardware), thiết lập này tạo ra một rào cản lớn. Bạn hoặc là phải tìm ngân sách cho một mạng lưới phụ khổng lồ, hoặc là phải chấp nhận hiệu suất yếu hơn.
Visual Contrastive Self-Distillation, hay VCSD, loại bỏ hoàn toàn rào cản đó. Thay vì tìm kiếm bên ngoài từ một mô hình giáo viên ngoại lai, mô hình tự học cách giám sát chính nó. Kỹ thuật này loại bỏ sự phụ thuộc thông thường vào các mô hình lớn hơn và sự giám sát bổ sung, nhưng nó vẫn đẩy điểm số benchmark lên cao. Kết quả là một vòng lặp huấn luyện tinh gọn hơn, rẻ hơn và dễ tái lập hơn.
Thuế ẩn từ các mô hình giáo viên bên ngoài
Kỹ thuật chưng cất tri thức (knowledge distillation) tiêu chuẩn trong thế giới thị giác-ngôn ngữ tuân theo một mô hình quen thuộc. Một mô hình lớn, có năng lực sẽ tạo ra các mục tiêu mềm (soft targets), bản đồ chú ý (attention maps) hoặc các dấu vết suy luận (reasoning traces). Mô hình học sinh nhỏ hơn cố gắng bắt chước các đầu ra này. Ý tưởng này rất hợp lý, nhưng việc thực thi lại rất nặng nề. Bạn cần các GPU hoặc TPU chạy mô hình giáo viên liên tục, thường với kích thước batch lớn hơn hoặc độ chính xác cao hơn so với mô hình học sinh. Bạn cũng cần các cặp dữ liệu được tuyển chọn, và đôi khi là các thông tin đặc quyền như các chuỗi suy luận thực tế (ground-truth reasoning chains) vốn rất đắt đỏ để thu thập hoặc đơn giản là không có sẵn cho lĩnh vực mục tiêu của bạn.
Những yêu cầu này làm tăng độ trễ trong quá trình thử nghiệm. Chúng làm tăng hóa đơn cơ sở hạ tầng. Và chúng tạo ra một sự phụ thuộc mong manh vào quy trình của bạn: nếu mô hình giáo viên thay đổi hoặc không khả dụng, chiến lược huấn luyện của bạn sẽ bị phá vỡ. VCSD được thiết kế để loại bỏ sự mong manh đó.
Một vòng lặp huấn luyện độc lập
Ý tưởng cốt lõi đằng sau VCSD đơn giản một cách tinh tế. Hệ thống duy trì một Trung bình trượt lũy thừa (Exponential Moving Average - EMA) của chính mô hình học sinh. EMA này đóng vai trò như một điểm tham chiếu ổn định, chứ không phải là một thực thể tiên tri (oracle) bên ngoài. Đối với mỗi hình ảnh huấn luyện, quy trình sẽ tạo ra hai đầu vào. Đầu tiên là hình ảnh gốc. Thứ hai là cùng hình ảnh đó nhưng nội dung đã bị xóa bỏ.
Sau đó, mô hình so sánh các phản hồi ở cấp độ token của chính nó với cả hai phiên bản. Khi nội dung thị giác biến mất, một số token nhất định sẽ thay đổi mạnh mẽ. Những token khác vẫn giữ nguyên. Những token thay đổi chính là những token thực sự giúp mô hình căn cứ các quyết định của mình vào bằng chứng thị giác thực tế. Những token vẫn ổn định có khả năng chỉ dựa vào các mô hình bề mặt, các thiên kiến thống kê hoặc các tiền đề ngôn ngữ (language priors) đơn thuần.
Bằng cách tập trung vào các token phản ứng với việc xóa bỏ, mô hình học được những đặc trưng thị giác nào thực sự quan trọng. Nó thực sự tự hỏi: “Tôi đã ngừng nhìn thấy điều gì, và điều đó đã thay đổi gì trong đầu ra của tôi?”. Câu hỏi đó trở thành tín hiệu huấn luyện. Toàn bộ quá trình diễn ra ngay trong vòng lặp hiện có. Không có bước lan truyền tiến (forward pass) thứ hai qua một mô hình giáo viên hàng tỷ tham số đang chạy trên một máy chủ khác.
Giải mã cơ chế
Để hiểu tại sao phương pháp này hiệu quả, hãy nghĩ về cách các mô hình thị giác-ngôn ngữ thường hoạt động. Một mô hình có thể mô tả chính xác một hình ảnh vì nó nhận ra ngữ cảnh xung quanh trong câu lệnh văn bản (text prompt), hoặc vì nó đã thấy các cặp hình ảnh-văn bản tương tự hàng nghìn lần trong quá trình tiền huấn luyện (pre-training). Nó có thể không thực sự nhìn vào đối tượng cụ thể mà bạn quan tâm. VCSD buộc mô hình phải trung thực.
Khi nội dung bị xóa, mô hình không còn có thể "gian lận" bằng cách dựa vào các mô hình quen thuộc đó nữa. Nếu câu trả lời của nó bị sụp đổ, hệ thống biết rằng câu trả lời ban đầu có căn cứ thị giác. Nếu câu trả lời vẫn giữ nguyên, hệ thống biết rằng mô hình đang dựa vào các lối tắt phi thị giác. Sự tương phản giữa hình ảnh gốc và hình ảnh đã bị xóa trở thành một bộ lọc nghiêm ngặt cho các đặc trưng có ý nghĩa.
Đây không phải là một hàm mất mát (loss) bổ sung được gắn thêm vào một cấu trúc vốn đã phức tạp. Đó là một sự tái định nghĩa mục tiêu chưng cất. Mô hình chưng cất tri thức từ chính "giáo viên EMA" của nó bằng cách sử dụng một bước kiểm tra tính nhất quán mà không yêu cầu gì khác ngoài dữ liệu huấn luyện bạn đã có sẵn.
Những con số cho thấy điều gì
Các tác giả của VCSD đã thử nghiệm phương pháp này trên các mô hình Qwen3-VL ở ba quy mô khác nhau, và kết quả đạt được là nhất quán. Mô hình 2 tỷ tham số đã tăng từ 62,27% lên 67,04%. Mô hình 4 tỷ tham số cải thiện từ 71,30% lên 73,16%. Mô hình 8 tỷ tham số đã nhảy vọt từ 72,51% lên 76,26%.
Đây không phải là những sự gia tăng nhỏ lẻ. Ở quy mô 2B, con số đó gần 5 điểm phần trăm. Ở quy mô 8B, mức tăng là gần 4 điểm. Trong các bài kiểm tra chuẩn về thị giác-ngôn ngữ, nơi mà sự cải thiện thường chỉ ở mức một phần nhỏ của phần trăm, những sự thay đổi này cho thấy mô hình đang học được khả năng liên kết thị giác (visual grounding) tốt hơn đáng kể, chứ không chỉ đơn thuần là tinh chỉnh bộ giải mã văn bản của nó.
Tác động thực tế đối với các nhà phát triển
VCSD quan trọng vì nó thay đổi bài toán kinh tế của việc huấn luyện mà không ảnh hưởng đến bài toán kinh tế của việc triển khai.
Thứ nhất, chi phí giảm ngay lập tức. Bạn không cần phải chuẩn bị, tải hoặc chạy một mô hình giáo viên (teacher model) khổng lồ song song với tác vụ huấn luyện của mình. Ngân sách tính toán của bạn thu hẹp lại chỉ còn mô hình học sinh (student model) và bản sao EMA shadow của nó, thứ mà bạn vốn đã đang duy trì.
Thứ hai, quy trình dữ liệu vẫn giữ được sự đơn giản. Bạn không cần các câu trả lời đặc quyền (privileged answers), các vết suy luận chuỗi tư duy (chain-of-thought traces), hay các tín hiệu giám sát khó tìm khác. Nếu bạn có các cặp hình ảnh-văn bản, bạn đã có mọi thứ mình cần. Việc tạo ra một bản sao đã bị xóa (erased copy) của mỗi hình ảnh là cực kỳ dễ dàng so với việc thu thập các chú thích suy luận của con người.
Thứ ba, tốc độ suy luận không thay đổi. Mọi thứ VCSD thực hiện đều diễn ra trong quá trình huấn luyện. Một khi bạn triển khai mô hình, nó chỉ là một checkpoint Qwen3-VL tiêu chuẩn. Không có các nhánh bổ sung, không có các đầu phụ (auxiliary heads), và không có chi phí vận hành (runtime overhead) phát sinh. Đặc tính triển khai với chi phí bằng không đó khiến nó trở nên lý tưởng cho cả các thiết bị biên
