언어 바꾸기English
이전 목록

덜 생성하고 더 많이 가져오기: 추론적 디코딩을 위한 하이브리드 트리 구성

Draft Less, Retrieve More: Hybrid Tree Construction for Speculative Decoding

TL;DR AI

핵심 요약

1분
  1. 연구진은 대규모 언어 모델의 speculative decoding을 위한 lossless·training-free 프레임워크 Graft를 제안했다.

  2. Graft는 pruning과 토큰 retrieval을 동적으로 결합해 draft tree의 coverage를 회복하고 acceptance rate를 높인다.

  3. 이 방식은 출력 품질을 유지하면서 추론 속도를 높여 speculative decoding의 실용성을 끌어올린다.

  4. EAGLE-3, Qwen3-235B, DFlash 등과의 비교를 포함해 여러 벤치마크와 다양한 컨텍스트에서 성능 향상을 보였다.

원문 보기