침묵 속 잠재 시각 추론 활용하기
Leveraging Latent Visual Reasoning in Silence

TL;DR AI
1분핵심 요약
연구진은 추론 시 latent visual token을 제거해도 여러 벤치마크에서 성능 저하가 크지 않다는 점을 확인하며, 이 토큰이 항상 드러나 있어야 한다는 가정에 의문을 제기했다.
다만 이 토큰들은 학습 과정에서는 멀티모달 모델의 시각적 grounding을 더 잘 배우도록 도와주며, 특히 시각·공간 추론에 유리했다.
연구팀은 이런 효과를 강화하기 위해 attention 기반 강화학습 보상을 도입했다.
이 방법은 시각-텍스트 추론 성능을 높이면서도, 시각 토큰이 필요 없을 때는 순수 텍스트 추론 능력을 유지한다.
