NVIDIA 새 연구, NeMo RL의 추측 디코딩으로 8B에서 롤아웃 생성 속도 1.8배 향상, 235B에서는 엔드투엔드 속도 2.5배 전망
New NVIDIA Research Shows Speculative Decoding in NeMo RL Achieves 1.8× Rollout Generation Speedup at 8B and Projects 2.5× End-to-End Speedup at 235B

TL;DR AI
1분핵심 요약
NVIDIA가 NeMo RL v0.6.0에 speculative decoding을 도입해 RL rollout 생성을 더 빠르게 만들었습니다.
이 방식은 draft 모델과 verifier 경로를 함께 사용하면서도 타깃 모델의 출력 분포를 정확히 유지합니다.
8B 규모에서는 생성 속도가 1.8배 빨라졌고, 235B 규모에서는 end-to-end로 약 2.5배 향상이 예상됩니다.
Rollout이 RL post-training의 핵심 병목인 만큼, 정책 분포를 바꾸지 않고 학습 시간과 비용을 줄일 수 있습니다.
