언어 바꾸기English
이전 목록

CONF-KV: 장기 맥락 LLM을 위한 혼합 정밀도 저장을 활용한 신뢰도 인식 KV 캐시 제거

CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM

TL;DR AI

핵심 요약

2분
  1. 연구진은 장문 컨텍스트 LLM 추론을 위한 confidence-aware KV 캐시 관리자 CONF-KV를 제안했다.

  2. 이 방식은 다음 토큰의 신뢰도를 바탕으로 캐시 예산을 조절하고, 최근 구간은 보호한 채 attention과 recency 신호로 토큰을 우선순위화해 제거한다.

  3. 또한 mixed-precision 저장과 attention 최적화를 함께 적용해 메모리 사용을 더 줄였다.

  4. 여러 모델과 긴 시퀀스 실험에서 512토큰 슬라이딩 윈도와 비슷한 수준의 메모리를 쓰면서도 full KV 대비 perplexity 차이를 약 1.5~2.1포인트로 유지했다.

  5. 검색 및 작업 벤치마크에서 슬라이딩 윈도와 H2O보다 우수했으며, Needle-in-a-Haystack과 VisualWebArena에서도 좋은 성능을 보였다.

원문 보기