PORTool: 보상 기반 트리와 함께하는 다중 도구 통합 추론을 위한 중요도 인식 정책 최적화
PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning

TL;DR AI
1분핵심 요약
연구진은 도구를 사용하는 LLM 에이전트를 위한 정책 최적화 기법 PORTool을 제안했다. 이 방법은 보상된 롤아웃 트리와 단계별 중요도 신호를 활용한다.
PORTool은 결과만 주어지는 감독 신호로부터 중간 도구 선택의 중요도를 파악해, 멀티툴 추론의 크레딧 할당 문제를 해결한다.
실험에서 PORTool은 기준 방법보다 더 적은 도구 호출로도 최종 답변 정확도를 높여, 효율성과 성능을 함께 개선했다.
이 연구는 퍼듀대와 애플이 수행했으며, ACL 2026과 NLG, Evaluation, and Metrics 워크숍에서 발표될 예정이다.