언어 바꾸기English
이전 목록

프로덕션용 W4A8: vLLM 통합 설명 | Cohere

Production-Ready W4A8: vLLM Integration Explained | Cohere

TL;DR AI

핵심 요약

1분
  1. Cohere가 NVIDIA Hopper GPU용 W4A8 양자화 추론 커널을 공개했다.

  2. 새 커널은 vLLM과 통합돼 dense 모델과 MoE 모델 모두에 적용된다.

  3. LUT 기반 디퀀타이제이션으로 FP8·INT4 변환 한계를 보완해 성능과 안정성을 높였다.

  4. 기존 W4A16 대비 첫 토큰 생성은 최대 58%, 출력 토큰 처리 속도는 최대 45% 빨라졌다.

원문 보기