메모리 제약은 있으나 대역폭 제약은 아닌: 배치-1 LLM 디코드에서의 물리적 AI 추론 격차
Memory-Bound but Not Bandwidth-Limited: The Physical AI Inference Gap in Batch-1 LLM Decode
TL;DR AI
1분핵심 요약
배치 1 LLM 디코딩 벤치마크는 지연 시간이 메모리 대역폭만으로 결정되지 않음을 보여준다.
H100 같은 더 빠른 GPU도 기대만큼 대역폭이 오르지 않았고, CUDA 그래프는 L4보다 H100에서 지연 감소 효과가 훨씬 컸다.
여러 양자화 추론 경로는 기대한 가중치 전송 절감을 제대로 내지 못했으며, GPTQ와 ExLlamaV2 조합이 예외에 가까웠다.
이 결과는 로봇과 같은 피지컬 AI 시스템의 단일 스트림 추론이 강한 하드웨어에서도 느릴 수 있음을 설명한다.
