LiveBrowseComp: 검색 에이전트는 정말 검색하는가, 아니면 이미 알고 있는 것을 확인할 뿐인가?
LiveBrowseComp: Are Search Agents Searching, or Just Verifying What They Already Know?

TL;DR AI
1분핵심 요약
BrowseComp 연구는 많은 LLM 검색 에이전트가 외부 증거보다 암기한 지식에 의존하며, 때로는 도구 없이도 답한다는 점을 보여줬다.
지원 증거를 제거하면 성능이 더 나빠지는 경우가 많아, 일부 시스템은 깊게 검색하기보다 이미 알고 있는 내용을 검증하는 데 가까웠다.
이를 보완하기 위해 연구진은 최근 90일 내 사실을 바탕으로 사람이 작성한 335개 질문으로 구성된 LiveBrowseComp를 만들었다.
평가된 에이전트들은 비공개(book) 환경에서 2% 미만을 기록했고 검색을 붙여도 급격히 성능이 떨어져, 최신 사실에 대한 진짜 심층 검색의 어려움을 드러냈다.
