이전 목록

Together AI, 긴 문맥 LLM 서빙을 위한 어텐션 인지 2비트 KV 캐시 양자화 시스템 OSCAR 오픈소스 공개

Together AI Open-Sources OSCAR: An Attention-Aware 2-Bit KV Cache Quantization System for Long-Context LLM Serving

TL;DR AI

핵심 요약

1분
  1. Together AI가 긴 컨텍스트 LLM 서빙용 2비트 KV 캐시 양자화 기법 OSCAR를 오픈소스로 공개했다.

  2. OSCAR는 어텐션 통계를 활용해 키와 값의 회전 방식을 선택함으로써 기존 INT2 방식의 정확도 저하를 줄인다.

  3. 이 방식은 SGLang 같은 paged serving 시스템과 호환되도록 설계돼 프로덕션용 캐시 레이아웃을 유지한다.

  4. KV 캐시 메모리와 트래픽을 줄여 더 큰 배치와 더 효율적인 GPU 서빙을 가능하게 할 수 있다.

원문 보기