LLM 추론을 위한 KV 캐시 압축 기술 10선: Eviction, 양자화, 저랭크 기법으로 메모리 오버헤드 줄이기
Top 10 KV Cache Compression Techniques for LLM Inference: Reducing Memory Overhead Across Eviction, Quantization, and Low-Rank Methods

TL;DR AI
1분핵심 요약
최근 10개 연구를 바탕으로 LLM 추론용 KV 캐시 압축 기법을 정리했으며, eviction, streaming, prefill, layer-wise, quantization, low-rank 방식까지 폭넓게 다룹니다.
각 기법이 프로덕션 파이프라인의 어디에 들어가고 어떻게 활용되는지 설명합니다.
KV 캐시 증가를 줄여 GPU 메모리 부담을 낮추고, 더 큰 배치와 더 빠른 추론을 가능하게 하며, 재학습 없이 긴 문맥 모델의 성능을 높일 수 있습니다.
