언어 바꾸기English
이전 목록

Sakana AI와 NVIDIA, LLM 추론 20.5%·학습 21.9% 속도 향상을 위한 CUDA 커널 탑재 TwELL 공개

Sakana AI and NVIDIA Introduce TwELL with CUDA Kernels for 20.5% Inference and 21.9% Training Speedup in LLMs

TL;DR AI

핵심 요약

1분
  1. Sakana AI와 NVIDIA가 LLM의 피드포워드 레이어를 위한 타일 기반 희소 표현 TwELL을 공개했다.

  2. TwELL은 CUDA 커널에 직접 통합돼 변환 오버헤드를 줄이고 GPU의 활성값 희소성을 더 잘 활용한다.

  3. 이 방식은 배치 추론과 학습 효율을 높여, 각각 20.5%와 21.9%의 속도 향상을 보고했다.

  4. 모델 구조를 바꾸지 않고도 고처리량 LLM 작업의 비용을 낮출 수 있는 실용적 방법으로 평가된다.

원문 보기