WIDE: 토큰 수준의 동적 폭 가지치기를 통한 적응형 LLM 추론 향상
WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning

TL;DR AI
1분핵심 요약
연구진은 LLM 추론을 더 빠르게 만들기 위해 토큰 단위로 주의(attention) 헤드와 FFN 채널 그룹을 선택적으로 줄이는 WIDE를 제안했다.
WIDE는 종단간 미분 가능한 프루닝 프레임워크와 2단계 학습, 그리고 프루닝-커널 공동 설계를 결합했다.
이 방법은 prefill과 decode 단계 모두에서 효율적인 실행을 지원하며, 기존 동적 프루닝보다 정확도 손실이 적다고 보고됐다.
50% 희소성에서도 측정 가능한 속도 향상을 보여, 속도와 품질의 균형을 더 정교하게 맞출 수 있음을 시사한다.
