SketchVLM: 비전-언어 모델이 이미지를 주석 처리해 생각을 설명하고 사용자를 안내할 수 있다
SketchVLM: Vision language models can annotate images to explain thoughts and guide users
TL;DR AI
1분핵심 요약
SketchVLM는 추가 학습 없이 비전-언어 모델이 이미지 위에 편집 가능한 SVG 스케치를 덧그려 답변을 설명하게 하는 프레임워크다.
이 시스템은 VLM이 비파괴적 오버레이를 생성하도록 유도해, 추론 과정을 이미지에서 바로 확인하고 수정할 수 있게 한다.
7개 벤치마크에서 SketchVLM은 기존 방법보다 정확도와 주석 품질을 모두 개선했다.
또한 Gemini-3-Pro와 GPT-5 같은 모델에서 단일 턴·다중 턴 인간-AI 상호작용을 지원한다.
