언어 바꾸기English
이전 목록

좌표나 영역 라벨 없이 시각적 문서 이해에서의 증거 귀속

Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

TL;DR AI

핵심 요약

1분
  1. 연구진이 시각 문서 QA에서 좌표 박스 대신 원문 인용구를 증거로 예측하는 언어 기반 인터페이스를 제안했다.

  2. 이 인용구를 파서와 검색기에 연결해 페이지 내 관련 영역을 찾아내며, region-level 라벨 없이도 학습할 수 있다.

  3. CiteVQA에서 증거 재현율은 최대 8%에서 약 47%로 올라가고, attribution hallucination은 절반가량 줄었다.

  4. GRPO 학습을 적용한 결과 strict attributed accuracy도 22.4%에서 33.8%로 개선됐다.

원문 보기