언어 바꾸기English
이전 목록

HINT-SD: 장기 지향 에이전트를 위한 표적 회고 자기 증류

HINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon Agents

TL;DR AI

핵심 요약

1분
  1. 연구진은 장기 지평 LLM 에이전트 학습을 위한 후향적 자가 증류 프레임워크 HINT-SD를 제안했다.

  2. 전체 궤적에서 실패를 유발한 행동 구간만 찾아 그 부분에만 피드백 조건부 증류를 적용한다.

  3. BFCL v3와 AppWorld에서 HINT-SD는 매 턴 피드백을 쓰는 밀집형 기준선보다 최대 18.8% 높은 성능을 보였다.

  4. 또한 학습 스텝 시간을 2.26배 줄여, 선택적 감독이 정확도와 효율을 동시에 높일 수 있음을 보여줬다.

원문 보기