Qwen 팀, NVIDIA Hopper GPU에서 최대 3배 성능 향상하는 고성능 선형 어텐션 커널 라이브러리 FlashQLA 공개
Qwen Team Releases FlashQLA: a High-Performance Linear Attention Kernel Library That Achieves Up to 3× Speedup on NVIDIA Hopper GPUs

TL;DR AI
1분핵심 요약
QwenLM이 Gated Delta Network 선형 어텐션을 위한 MIT 라이선스 GPU 커널 라이브러리 FlashQLA를 공개했다.
TileLang 기반으로 구현됐으며, Triton 기반의 느린 커널을 Hopper 전용 최적화로 대체한다.
테스트 환경에서 순전파는 약 2~3배, 역전파는 약 2배 빨라졌다.
이번 개선은 긴 컨텍스트 LLM 워크로드의 핵심 병목을 겨냥하며, 특히 NVIDIA Hopper GPU(H100, H200)에서 효과적이다.
Qwen3.5, Qwen3.6 및 다른 Hopper 기반 배포의 지연시간과 연산 비용을 낮출 수 있다.
