도미노: 추측 디코딩에서 인과적 모델링과 자기회귀 초안 작성을 분리하기
Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding
TL;DR AI
1분핵심 요약
연구진이 더 빠른 LLM 추론을 위한 speculative decoding 프레임워크 Domino를 공개했다.
Domino는 병렬 백본으로 토큰 블록을 초안 생성하고, 가벼운 prefix-aware 보정 헤드로 이를 다듬는 구조이며 안정화된 학습 커리큘럼을 사용한다.
Qwen3 모델에서 Transformers 기준 최대 5.49배의 end-to-end 속도 향상, SGLang 기준 5.8배의 처리량 향상을 보고했다.
이 방식은 블록 단위 병렬 생성의 효율을 유지하면서 인과적 의존성 모델링을 보완해 지연시간과 처리량을 개선하는 것을 목표로 한다.
