AI 검색 에이전트는 실제로 웹을 조사하기보다 이미 알고 있는 내용을 확인하는 경우가 많다
AI search agents often confirm what they already know instead of actually researching the web

TL;DR AI
1분핵심 요약
하얼빈공업대와 샤오훙슈 연구진은 11개 AI 모델을 테스트한 결과, 웹 도구 없이도 높은 성능을 내는 경우가 많아 내부 지식에 크게 의존한다는 점을 확인했다.
검색이 가능해도 관련 문서를 제거하면 성능이 오히려 비공개(book) 상태보다 떨어지는 경우가 많아, 검색이 정답 찾기를 방해할 수 있음을 보였다.
연구팀은 실제 브라우징 능력을 더 잘 측정하기 위해, 학습 데이터에 들어갔을 가능성이 낮은 최신 사실로 구성한 시의성 벤치마크 LiveBrowseComp를 만들었다.
이번 연구는 현재의 AI 검색 벤치마크가 실제 웹 조사 능력보다 암기된 지식을 과대평가할 수 있다고 지적한다.
