dMoE: 학습 가능한 블록 전문가가 있는 dLLM
dMoE: dLLMs with Learnable Block Experts
TL;DR AI
1분핵심 요약
연구진은 확산형 대규모 언어모델을 위한 블록 단위 MoE 방식인 dMoE를 제안했다.
토큰별로 전문가를 고르는 대신, 토큰들의 선호를 모아 블록마다 하나의 라우팅 결정을 내린다.
그 결과 활성화되는 전문가 수가 줄고, 메모리 사용량과 전체 지연 시간이 함께 개선됐다.
기본 성능은 거의 유지하면서 추론 효율을 높인 점이 핵심이다.