RTX 3090에서 Qwen3.5-27B로 207 tok/s를 달성했다 | Hacker News
We got 207 tok/s with Qwen3.5-27B on an RTX 3090 | Hacker News
TL;DR AI
1분핵심 요약
ggml 기반의 독립형 C++ 추론 구현으로 Qwen3.5-27B를 RTX 3090 단일 GPU에서 구동해 최대 207.6 tok/s를 달성했다.
스펙큘러티브 디코딩, DFlash, DDTree를 결합해 토큰 처리량을 크게 끌어올렸으며, llama.cpp 대비 더 높은 성능을 보였다.
KV 양자화와 메모리 최적화를 통해 128K 컨텍스트를 24GB VRAM 안에 수용할 수 있게 했다.
이 결과는 소비자용 GPU에서도 대형 하이브리드 모델을 더 빠르고 효율적으로 실행할 수 있음을 보여준다.



