RUBRIC-ARROW: 검증 불가능한 도메인에서 LLM 후학습을 위한 교차 포인트별 루브릭 보상 모델링
RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains
TL;DR AI
1분핵심 요약
연구진은 LLM 사후 학습을 위한 교대식 보상 모델링 프레임워크 RUBRIC-ARROW를 제안했다.
이 방식은 루브릭 생성기와 루브릭 조건부 판별기를 함께 학습하고, 강화학습에 쌍대 선호 데이터를 활용한다.
또한 동률이 잦은 점수형 평가 대신 확률 기반 루브릭 스코어링을 사용해 답변 간 구분력을 높인다.
실험에서는 보상 모델링 성능이 더 강해졌고, GRPO를 포함한 후속 사후 학습 결과도 개선됐다.
