KVServe: 통신 효율적인 분리형 LLM 서빙을 위한 서비스 인식 KV 캐시 압축
KVServe: Service-Aware KV Cache Compression for Communication-Efficient Disaggregated LLM Serving
TL;DR AI
1분핵심 요약
연구진은 분산 LLM 서빙을 위한 모듈형·적응형 KV 캐시 압축 프레임워크 KVServe를 제안했다.
KVServe는 베이지안 탐색과 온라인 밴딧 컨트롤러를 사용해 워크로드와 서비스 목표에 맞는 압축 프로필을 선택한다.
vLLM 기반 실험에서 job completion time과 time-to-first-token을 크게 개선했다.
이번 결과는 고정된 정적 설정 없이도 서비스 인지형 압축으로 네트워크 비용과 지연을 줄일 수 있음을 보여준다.
