Google의 TurboQuant, LLM KV 캐시 메모리 요구량을 최소 6배 저감 — Nvidia H100에서 최대 8배 성능 향상, KV 캐시 3비트로 압축해 정확도 손실 없음
Google's TurboQuant reduces AI LLM cache memory capacity requirements by at least six times — up to 8x performance boost on Nvidia H100 GPUs, compresses KV caches to 3 bits with no accuracy loss

TL;DR AI
2분핵심 요약
TurboQuant 발표되었다, google Research는 TurboQuant를 발표했으며 훈련이 필요 없는 압축 알고리즘으로 KV 캐시를 3비트로 양자화해 모델 정확도 손실이 없다고 밝혔다.
Nvidia H100에서 최대 8배 성능을 보였다 4비트 TurboQuant는 Nvidia H100 GPU에서 32비트 키 비압축 대비 최대 8배의 주의(logits) 계산 속도 향상을 제공했다.
KV 캐시 메모리를 최소 6배 감소시켰다 벤치마크에서 TurboQuant는 KV 캐시 메모리를 최소 6배 줄였다.
KV 캐시를 3비트로 양자화한다, turboQuant는 모델 정확도 손실 없이 KV 캐시를 3비트로 압축한다.
PolarQuant 벡터를 극좌표로 변환해 블록 정규화를 생략한다, polarQuant는 벡터를 데카르트 좌표에서 극좌표로 변환해 반지름과 각도로 분리하고 블록별 정규화 단계를 건너뛴다.
