MIT, NVIDIA, 저장강소대 연구진, 풀 어텐션과 같은 성능의 KV 캐시 압축 기법 ‘TriAttention’ 제안…처리량 2.5배 향상
Researchers from MIT, NVIDIA, and Zhejiang University Propose TriAttention: A KV Cache Compression Method That Matches Full Attention at 2.5× Higher Throughput

TL;DR AI
1분핵심 요약
MIT, NVIDIA, Zhejiang University 연구진이 긴 문맥 LLM 추론용 KV 캐시 압축 기법 TriAttention을 제안했다.
기존 방식이 post-RoPE 공간에서 토큰 중요도를 평가하는 것과 달리, TriAttention은 pre-RoPE Q/K 집중도를 활용해 더 잘 보존할 캐시 토큰을 고른다.
AIME25에서 32K 토큰 생성 기준으로 full attention과 같은 정확도를 유지하면서 2.5배 높은 처리량 또는 10.7배 적은 KV 메모리를 달성했다.
이 방법은 정확도를 유지한 채 GPU 메모리 부담을 줄여, 긴 추론 작업을 더 현실적으로 만들 수 있다.
