언어 바꾸기English
이전 목록

Harness-1: 상태 외부화 하네스를 활용한 검색 에이전트용 강화학습

Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses

TL;DR AI

핵심 요약

1분
  1. 연구진은 강화학습으로 훈련한 20B 규모의 검색 서브에이전트 Harness-1을, 상태를 유지하는 검색 하니스 안에 도입했다.

  2. 이 하니스는 후보군, 정제된 증거, 검증 기록, 압축 관찰 등 메모리와 보조 작업을 환경 측에서 관리해 모델이 검색, 문서 선택, 검증, 중단 판단에 집중하게 한다.

  3. Harness-1은 8개 벤치마크에서 강한 성능을 보였고, 특히 보지 못한 전이형 검색 과제에서 크게 개선됐다.

  4. 이번 연구는 작업 기억을 환경이 맡기면 검색 에이전트의 강화학습 효율이 높아지고 새로운 검색 환경으로의 전이도 좋아질 수 있음을 보여준다.

원문 보기