알리바바의 HDPO, AI 에이전트 도구 과다 사용을 98%에서 2%로 줄여
Alibaba's HDPO cuts AI agent tool overuse from 98% to 2%

TL;DR AI
1분핵심 요약
알리바바 연구진은 AI 에이전트의 정확성과 효율성 목표를 분리해 학습하는 Hierarchical Decoupled Policy Optimization(HDPO)을 제안했다.
멀티모달 모델 Metis는 불필요한 도구 호출을 98%에서 2%로 줄여, 과도한 툴 사용 문제를 크게 완화했다.
Metis는 주요 벤치마크에서 최첨단 수준의 추론 성능도 달성해, 성능과 배포 효율을 동시에 개선할 가능성을 보였다.
이번 연구는 AI 에이전트가 언제 외부 도구를 쓸지, 언제 내부 지식으로 해결할지를 더 잘 판단하게 해 지연 시간·비용·오류를 줄이는 데 초점을 맞춘다.



