처음부터 시각-언어 모델(vision-language model)을 학습시키는 것은 항상 많은 자원이 소모되는 작업이었습니다. 대부분의 현대적 접근 방식은 증류(distillation)에 의존하는데, 이는 학습시키려는 학생 모델보다 일반적으로 더 큰 강력한 교사 모델(teacher model)에 먼저 접근할 수 있어야 함을 의미합니다. 교사 모델을 실행하기 위한 연산 비용을 지불하고, 데이터를 공급하는 파이프라인을 관리하며, 두 모델의 동기화를 유지하기 위한 엔지니어링 오버헤드를 감당해야 합니다. 소규모 팀이나 엣지 하드웨어용 모델을 구축하는 이들에게 이러한 설정은 높은 장벽이 됩니다. 거대한 보조 네트워크를 위한 예산을 확보하거나, 아니면 성능 저하를 감수해야 합니다.

시각 대조 자기 증류(Visual Contrastive Self-Distillation, VCSD)는 이러한 장벽을 완전히 제거합니다. 외부의 교사 모델을 찾는 대신, 모델은 스스로를 감독하는 법을 배웁니다. 이 기술은 더 큰 모델과 추가적인 감독에 대한 일반적인 의존성을 제거하면서도 벤치마크 점수를 높입니다. 그 결과, 더 가볍고 저렴하며 재현하기 쉬운 학습 루프가 만들어집니다.

외부 교사 모델의 숨겨진 비용

시각-언어 분야의 표준 지식 증류는 익숙한 패턴을 따릅니다. 크고 유능한 모델이 소프트 타겟(soft targets), 어텐션 맵(attention maps) 또는 추론 흔적(reasoning traces)을 생성합니다. 더 작은 학생 모델은 이러한 출력을 모방하려고 시도합니다. 아이디어는 타당하지만, 실행 과정은 무겁습니다. 학생 모델보다 더 큰 배치 사이즈나 높은 정밀도로 교사 모델을 지속적으로 실행할 GPU 또는 TPU가 필요합니다. 또한 정제된 데이터 쌍이 필요하며, 때로는 수집 비용이 많이 들거나 대상 도메인에서 구할 수 없는 정답 추론 체인(ground-truth reasoning chains)과 같은 특권 정보가 필요하기도 합니다.

이러한 요구 사항은 실험의 지연 시간을 늘리고 인프라 비용을 부풀립니다. 또한 파이프라인에 취약한 의존성을 삽입합니다. 교사 모델이 변경되거나 사용할 수 없게 되면 학습 전략이 무너집니다. VCSD는 이러한 취약성을 제거하기 위해 설계되었습니다.

독립적인 학습 루프

VCSD의 핵심 아이디어는 우아할 정도로 단순합니다. 시스템은 학생 모델 자체의 지수 이동 평균(Exponential Moving Average, EMA)을 유지합니다. 이 EMA는 외부의 신탁(oracle)이 아닌 안정적인 기준점 역할을 합니다. 모든 학습 이미지에 대해 파이프라인은 두 가지 입력을 생성합니다. 첫 번째는 원본 이미지입니다. 두 번째는 콘텐츠가 삭제된 동일한 이미지입니다.

그런 다음 모델은 두 버전 모두에 대해 자신의 토큰 수준 응답을 비교합니다. 시각적 콘텐츠가 사라지면 특정 토큰이 급격하게 변합니다. 다른 토큰들은 거의 그대로 유지됩니다. 변화하는 토큰은 모델의 결정을 실제 시각적 증거에 기반하게 했던 토큰들입니다. 안정적으로 유지되는 토큰은 표면적인 패턴, 통계적 편향 또는 언어적 사전 지식(language priors)에만 의존했을 가능성이 높습니다.

삭제에 반응하는 토큰에 집중함으로써, 모델은 어떤 시각적 특징이 진정으로 중요한지를 배웁니다. 모델은 사실상 스스로에게 “내가 무엇을 보지 못하게 되었으며, 그것이 내 출력에 어떤 변화를 주었는가?”라고 묻는 셈입니다. 이 질문이 학습 신호가 됩니다. 전체 과정은 기존 루프 내부에서 발생합니다. 다른 서버에 있는 수십억 개의 파라미터를 가진 교사 모델을 통한 별도의 순전파(forward pass)는 필요하지 않습니다.

메커니즘 해독

이 방식이 왜 작동하는지 이해하려면 시각-언어 모델이 흔히 어떻게 행동하는지 생각해 보십시오. 모델은 텍스트 프롬프트의 주변 문맥을 인식하거나, 사전 학습 중에 유사한 이미지-텍스트 쌍을 수천 번 보았기 때문에 이미지를 정확하게 캡션할 수 있습니다. 실제로 여러분이 관심을 갖는 특정 객체를 보고 있지 않을 수도 있습니다. VCSD는 정직함을 강제합니다.

콘텐츠가 삭제되면 모델은 익숙한 패턴에 의존하여 속임수를 쓸 수 없습니다. 답변이 무너지면 시스템은 원래의 답변이 시각적으로 접지(visually grounded)되어 있었다는 것을 알게 됩니다. 답변이 그대로라면 시스템은 모델이 비시각적 지름길에 의존하고 있었다는 것을 알게 됩니다. 원본 이미지와 삭제된 이미지 사이의 대비는 의미 있는 특징을 걸러내는 강력한 필터가 됩니다.

이것은 이미 복잡한 스택에 덧붙여진 추가적인 손실(loss)이 아닙니다. 이는 증류 대상을 재구성한 것입니다. 모델은 이미 보유하고 있는 학습 데이터 외에는 아무것도 필요하지 않은 일관성 검사를 사용하여 자신의 EMA 교사로부터 지식을 증류합니다.

수치가 보여주는 것

VCSD 저자들은 세 가지 규모의 Qwen3-VL 모델에서 이 방법을 테스트했으며, 그 이득은 일관적이었습니다. 20억(2 billion) 파라미터 모델은 62.27%에서 67.04%로 향상되었습니다. 40억(4 billion) 파라미터 모델은 71.30%에서 73.16%로 개선되었습니다. 80억(8 billion) 파라미터 모델은 72.51%에서 76.26%로 급증했습니다.

이것은 미미한 수치 상승이 아닙니다. 2B 규모에서는 거의 5퍼센트 포인트에 달하며, 8B 규모에서는 그 차이가 거의 4포인트에 육박합니다. 개선 사항이 종종 1% 미만의 미세한 단위로 나타나는 시각-언어 벤치마크에서, 이러한 변화는 모델이 단순히 텍스트 디코더를 튜닝하는 것을 넘어 훨씬 더 나은 시각적 접지(visual grounding)를 학습하고 있음을 시사합니다.

개발자를 위한 실질적인 영향

VCSD가 중요한 이유는 배포의 경제성에는 영향을 주지 않으면서 학습의 경제성을 변화시키기 때문입니다.

첫째, 비용이 즉각적으로 감소합니다. 학습 작업과 병렬로 거대한 티처 모델(teacher model)을 프로비저닝하거나, 로드하거나, 실행할 필요가 없습니다. 컴퓨팅 예산은 이미 유지하고 있는 학생 모델(student model)과 그 EMA shadow로 축소됩니다.

둘째, 데이터 파이프라인이 단순하게 유지됩니다. 특권적 정답(privileged answers), 사고의 사슬(chain-of-thought) 추적 또는 기타 확보하기 어려운 감독 신호(supervision signals)가 필요하지 않습니다. 이미지-텍스트 쌍만 있다면 필요한 모든 것을 갖춘 셈입니다. 인간의 추론 주석(human reasoning annotations)을 수집하는 것에 비하면, 각 이미지의 삭제된 복사본(erased copy)을 생성하는 것은 매우 간단합니다.

셋째, 추론 속도는 변하지 않습니다. VCSD가 수행하는 모든 작업은 학습 중에 이루어집니다. 모델을 배포하고 나면, 그것은 단지 표준 Qwen3-VL 체크포인트일 뿐입니다. 추가적인 브랜치나 보조 헤드(auxiliary heads), 런타임 오버헤드가 없습니다. 이러한 제로 코스트(zero-cost) 배포 특성은 엣지 디바이스 모두에 이상적입니다