HINT-SD: 장기 지향 에이전트를 위한 표적 회고 자기 증류
HINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon Agents
TL;DR AI
1분핵심 요약
연구진은 장기 지평 LLM 에이전트 학습을 위한 후향적 자가 증류 프레임워크 HINT-SD를 제안했다.
전체 궤적에서 실패를 유발한 행동 구간만 찾아 그 부분에만 피드백 조건부 증류를 적용한다.
BFCL v3와 AppWorld에서 HINT-SD는 매 턴 피드백을 쓰는 밀집형 기준선보다 최대 18.8% 높은 성능을 보였다.
또한 학습 스텝 시간을 2.26배 줄여, 선택적 감독이 정확도와 효율을 동시에 높일 수 있음을 보여줬다.
