이전 목록

VibeSearchBench: 현실 환경에서 장기적 선제 검색을 벤치마킹하다

VibeSearchBench: Benchmarking Long-horizon Proactive Search in the Wild

TL;DR AI

핵심 요약

1분
  1. 연구진은 20개 도메인, 200개 정제 과제로 구성된 장기형 능동 검색 벤치마크 VibeSearchBench를 공개했다.

  2. 이 벤치마크는 점진적 정보 공개 시뮬레이션과 그래프 기반 평가로, 모호하고 반복적인 실제 검색 행동을 재현한다.

  3. Claude Opus 4.6, GPT-5.4, Gemini-3.1 Pro 등 7개 최첨단 모델을 시험한 결과 성능은 낮았고, 어떤 모델도 사용자 완료 신호에 도달하지 못했다.

  4. 이번 결과는 기존 검색 에이전트 벤치마크와 실제 사용자 요구 사이의 큰 괴리를 드러내며, 능동적 장거리 검색이 아직 해결되지 않았음을 보여준다.

원문 보기