프로덕션용 W4A8: vLLM 통합 설명 | Cohere
Production-Ready W4A8: vLLM Integration Explained | Cohere

TL;DR AI
1분핵심 요약
Cohere가 NVIDIA Hopper GPU용 W4A8 양자화 추론 커널을 공개했다.
새 커널은 vLLM과 통합돼 dense 모델과 MoE 모델 모두에 적용된다.
LUT 기반 디퀀타이제이션으로 FP8·INT4 변환 한계를 보완해 성능과 안정성을 높였다.
기존 W4A16 대비 첫 토큰 생성은 최대 58%, 출력 토큰 처리 속도는 최대 45% 빨라졌다.

