언어 바꾸기English
이전 목록

자기 확신이 잘못 이끌 때: 검증 가능한 보상을 위한 강화학습의 능동적 라벨 획득

When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards

TL;DR AI

핵심 요약

1분
  1. 연구진은 RLAVR를 제안해, 검증 가능한 보상을 사용하는 강화학습을 더 적은 라벨로도 안정적으로 학습할 수 있게 했다.

  2. RLAVR은 의사 라벨만 쓰는 대신, 일부 샘플에 대해 능동적으로 획득한 정답 라벨과 의사 라벨을 함께 활용한다.

  3. 이 방법은 Corrective Advantage Gap(CAG)로 가치 있는 샘플을 찾고, 실제 획득 정책으로 CARE를 사용한다.

  4. 실험에서는 다양한 도메인과 모델 규모에서 안정성과 성능이 향상돼, 추론 모델 학습의 핵심 병목을 완화하는 것으로 나타났다.

원문 보기