언어 바꾸기English
이전 목록

Qwen 팀, NVIDIA Hopper GPU에서 최대 3배 성능 향상하는 고성능 선형 어텐션 커널 라이브러리 FlashQLA 공개

Qwen Team Releases FlashQLA: a High-Performance Linear Attention Kernel Library That Achieves Up to 3× Speedup on NVIDIA Hopper GPUs

TL;DR AI

핵심 요약

1분
  1. QwenLM이 Gated Delta Network 선형 어텐션을 위한 MIT 라이선스 GPU 커널 라이브러리 FlashQLA를 공개했다.

  2. TileLang 기반으로 구현됐으며, Triton 기반의 느린 커널을 Hopper 전용 최적화로 대체한다.

  3. 테스트 환경에서 순전파는 약 2~3배, 역전파는 약 2배 빨라졌다.

  4. 이번 개선은 긴 컨텍스트 LLM 워크로드의 핵심 병목을 겨냥하며, 특히 NVIDIA Hopper GPU(H100, H200)에서 효과적이다.

  5. Qwen3.5, Qwen3.6 및 다른 Hopper 기반 배포의 지연시간과 연산 비용을 낮출 수 있다.

원문 보기