Sakana AI와 NVIDIA, LLM 추론 20.5%·학습 21.9% 속도 향상을 위한 CUDA 커널 탑재 TwELL 공개
Sakana AI and NVIDIA Introduce TwELL with CUDA Kernels for 20.5% Inference and 21.9% Training Speedup in LLMs

TL;DR AI
1분핵심 요약
Sakana AI와 NVIDIA가 LLM의 피드포워드 레이어를 위한 타일 기반 희소 표현 TwELL을 공개했다.
TwELL은 CUDA 커널에 직접 통합돼 변환 오버헤드를 줄이고 GPU의 활성값 희소성을 더 잘 활용한다.
이 방식은 배치 추론과 학습 효율을 높여, 각각 20.5%와 21.9%의 속도 향상을 보고했다.
모델 구조를 바꾸지 않고도 고처리량 LLM 작업의 비용을 낮출 수 있는 실용적 방법으로 평가된다.
