TRACER: 협력적 멀티 LLM 추론을 위한 내부 강화 크레딧이 적용된 턴 단위 후회 매칭
TRACER: Turn-level Regret Matching with Inner Reinforcement Credit for Cooperative Multi-LLM Reasoning

TL;DR AI
1분핵심 요약
연구진은 협력형 다중 LLM 추론을 위한 강화학습 프레임워크 TRACER를 제안했다.
TRACER는 발화 여부를 정하는 턴 단위 제어와, proposer·reviewer 출력에 대한 생성 단위 보상을 분리해 학습한다.
모델이 언제 말하고 무엇을 말할지 함께 배우게 해 협업 추론을 높이고, 무임승차와 연산 비용을 줄이는 것이 목표다.
TRACER는 GSM8K, MATH500, GPQA-Diamond 등 수학·과학 벤치마크에서 평가됐다.
