Google, TurboQuant 발표: LLM 키-값 캐시 메모리 6배 절감·최대 8배 속도 향상, 정확도 손실 없음
Google Introduces TurboQuant: A New Compression Algorithm that Reduces LLM Key-Value Cache Memory by 6x and Delivers Up to 8x Speedup, All with Zero Accuracy Loss

TL;DR AI
2분핵심 요약
TurboQuant Google Research가 제안했다, google Research가 KV 캐시 압축을 위한 데이터-오블리비어스 양자화 프레임워크 TurboQuant를 제안했다.
KV 캐시 메모리를 6배로 감소시킬 수 있다 발표에 따르면 TurboQuant는 KV 캐시 메모리를 약 6배 줄이고 최대 8배 속도 향상을 제공할 수 있다.
TurboQuant 무작위 회전과 좌표별 스칼라 양자화를 적용한다, turboQuant는 입력 벡터에 무작위 회전을 적용한 뒤 좌표별 스칼라 양자화를 수행한다.
MSE 왜곡이 정보이론적 하한의 ≈2.7배 이내다, turboQuant의 MSE 왜곡은 모든 비트폭에서 정보이론적 하한의 약 2.7배 이내로 보고되었다.
B=1에서 MSE 왜곡이 0.36이다 비트폭 b=1에서 TurboQuant의 MSE 왜곡은 0.36이고 하한은 0.25로 보고되었다.



