GDSD: 확산 언어 모델을 위한 유도 디노이저 자기 증류로서의 강화 학습
GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models
TL;DR AI
1분핵심 요약
연구진은 강화학습으로 확산 언어모델을 훈련하는 Guided Denoiser Self-Distillation(GDSD)을 제안했습니다.
GDSD는 reverse-KL로 정규화한 RL에서 얻은 self-teacher에 denoiser logits를 맞추며, 편향이 생길 수 있는 ELBO 기반 likelihood 대리값을 피합니다.
계획, 수학, 코딩 벤치마크에서 LLaDA-8B와 Dream-7B에 적용했을 때 정확도와 학습 안정성이 모두 향상됐습니다.
최대 19.6%의 성능 향상이 보고됐으며, train-inference mismatch 없이 diffusion LLM을 개선할 유망한 방법으로 보입니다.
