ACL 2026: Alibaba DAMO Academy의 I2B-LPO, RLVR 획일화 깨다 — 반복적 샘플링에서 효과적인 탐색으로
ACL 2026: Alibaba DAMO Academy's I2B-LPO Breaks RLVR Homogenization — From Repetitive Sampling to Effective Exploration

TL;DR AI
1분핵심 요약
알리바바 DAMO Academy가 RLVR 후학습을 위한 탐색 강화 프레임워크 I2B-LPO를 공개했다.
반복적인 샘플링 대신 더 다양하고 정보량이 높은 추론 경로를 유도하도록 설계됐다.
수학 벤치마크에서 정확도는 최대 5.3%, 의미적 다양성은 최대 7.4% 향상된 것으로 보고됐다.
이는 RLVR에서 샘플 수를 늘리는 것만으로는 학습이 좋아지지 않는다는 한계를 보완한다.
이 연구는 알리바바 Intelligent Decision 팀의 성과로, ACL 2026 Main에 채택됐다.



