비주얼 대조 자기 증류
Visual Contrastive Self-Distillation
TL;DR AI
1분핵심 요약
연구진은 비전-언어 모델을 위한 새로운 학습 방법인 Visual Contrastive Self-Distillation(VCSD)을 제안했다.
VCSD는 원본 이미지와 내용이 지워진 이미지에 대한 교사 출력을 비교해 학생 모델에 더 날카로운 학습 신호를 만든다.
이 방식은 특권 정답, 시각적 근거, 외부 교사를 필요로 하지 않아 자기 증류를 단순화하며 추가 추론 비용도 없다.
Qwen3-VL과 Qwen3.5 모델에서 VCSD는 기존 on-policy self-distillation보다 종합 벤치마크 성능이 더 좋았다.