덜 생성하고 더 많이 가져오기: 추론적 디코딩을 위한 하이브리드 트리 구성
Draft Less, Retrieve More: Hybrid Tree Construction for Speculative Decoding
TL;DR AI
1분핵심 요약
연구진은 대규모 언어 모델의 speculative decoding을 위한 lossless·training-free 프레임워크 Graft를 제안했다.
Graft는 pruning과 토큰 retrieval을 동적으로 결합해 draft tree의 coverage를 회복하고 acceptance rate를 높인다.
이 방식은 출력 품질을 유지하면서 추론 속도를 높여 speculative decoding의 실용성을 끌어올린다.
EAGLE-3, Qwen3-235B, DFlash 등과의 비교를 포함해 여러 벤치마크와 다양한 컨텍스트에서 성능 향상을 보였다.
