언어 바꾸기English
이전 목록

도미노: 추측 디코딩에서 인과적 모델링과 자기회귀 초안 작성을 분리하기

Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding

TL;DR AI

핵심 요약

1분
  1. 연구진이 더 빠른 LLM 추론을 위한 speculative decoding 프레임워크 Domino를 공개했다.

  2. Domino는 병렬 백본으로 토큰 블록을 초안 생성하고, 가벼운 prefix-aware 보정 헤드로 이를 다듬는 구조이며 안정화된 학습 커리큘럼을 사용한다.

  3. Qwen3 모델에서 Transformers 기준 최대 5.49배의 end-to-end 속도 향상, SGLang 기준 5.8배의 처리량 향상을 보고했다.

  4. 이 방식은 블록 단위 병렬 생성의 효율을 유지하면서 인과적 의존성 모델링을 보완해 지연시간과 처리량을 개선하는 것을 목표로 한다.

원문 보기