언어 바꾸기English
이전 목록

DelTA: 검증 가능한 보상으로부터 강화학습을 위한 판별적 토큰 크레딧 할당

DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards

TL;DR AI

핵심 요약

1분
  1. 연구진은 검증 가능한 보상 기반 강화학습(RLVR)을 위한 판별적 토큰 크레딧 할당 기법 DelTA를 제안했다.

  2. DelTA는 흔하고 잡음이 많은 패턴의 영향은 줄이고, 정보성 높은 토큰의 기여는 더 크게 반영하도록 가중치를 조정한다.

  3. 이 방법은 Qwen3-8B-Base와 Qwen3-14B-Base를 포함한 수학 추론·코드 생성 벤치마크에서 성능 향상을 보였다.

  4. 응답 수준의 보상을 토큰 수준 업데이트로 더 효과적으로 바꿔, 추론 성능과 일반화 능력을 높인다.

원문 보기