좌표나 영역 라벨 없이 시각적 문서 이해에서의 증거 귀속
Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels
TL;DR AI
1분핵심 요약
연구진이 시각 문서 QA에서 좌표 박스 대신 원문 인용구를 증거로 예측하는 언어 기반 인터페이스를 제안했다.
이 인용구를 파서와 검색기에 연결해 페이지 내 관련 영역을 찾아내며, region-level 라벨 없이도 학습할 수 있다.
CiteVQA에서 증거 재현율은 최대 8%에서 약 47%로 올라가고, attribution hallucination은 절반가량 줄었다.
GRPO 학습을 적용한 결과 strict attributed accuracy도 22.4%에서 33.8%로 개선됐다.
