FineVerify: 세밀한 자기 검증을 통한 에이전트 검색의 테스트 시점 컴퓨팅 확장
FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search
TL;DR AI
1분핵심 요약
연구진은 복잡한 질문을 더 작은 검증 가능한 하위 질문으로 나누는 에이전틱 검색용 자기 검증 프레임워크 FineVerify를 제안했다.
샘플링한 에이전트 궤적을 이런 로컬 검증 기준으로 채점해 가장 높은 점수를 받은 후보를 선택하며, 테스트 시 검증을 더 세밀하고 해석 가능하게 만든다.
4개 에이전틱 검색 벤치마크와 2개 모델에서 FineVerify는 기존 스케일링 기준을 능가했으며, GPT-5-mini와 Gemini-3-flash에서도 성능 향상을 보였다.
12개 샘플에서는 GPT-5-mini가 BrowseComp-Plus에서 GPT-5를 넘어서는 결과도 냈다.
