RT-Lynx: 확산 모델을 위한 GEMM 희소성을 올바르게 활용하기
RT-Lynx: Putting GEMM Sparsity in the Right Way for Diffusion Models
TL;DR AI
1분핵심 요약
RT-Lynx는 가중치가 아니라 활성화를 희소화해 diffusion transformer의 추론 속도를 높이는, 더 하드웨어 친화적인 접근을 제시했다.
보상 메커니즘과 LoRA 브랜치를 더해 이미지 생성 품질 저하를 최소화하면서 속도를 유지한다.
맞춤형 fused CUDA 커널과 2:4 준구조적 희소성을 활용해 Tensor Core 효율을 높이고 GEMM 비용을 줄였다.
Qwen-Image, FLUX.1-dev, Z-Image 등의 모델 실험에서, 눈에 띄는 품질 손실 없이 속도 향상을 보였다.
