Maestro: 계층적 모델-스킬 앙상블을 지휘하는 강화학습
Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles
TL;DR AI
1분핵심 요약
Maestro는 멀티모달 작업을 전문가 모델과 스킬을 순차적으로 조합하는 의사결정 문제로 보는 RL 기반 오케스트레이션 프레임워크다.
이 시스템은 단계별 정답 없이 결과 기반 피드백만으로 학습했고, 4B 정책이 GPT-5와 Gemini-2.5-Pro보다 더 높은 평균 벤치마크 성능을 보였다.
또한 보지 못한 전문가에도 잘 일반화했으며 계산 비용을 낮게 유지해, 재학습 없이도 효율적인 라우팅이 가능함을 보여줬다.
이는 작은 오케스트레이터가 특화된 도구와 스킬을 학습해 조율함으로써 훨씬 큰 모델보다 더 나은 성능을 낼 수 있음을 시사한다.
