언어 바꾸기English
이전 목록

TileLang으로 고성능 GPU 커널 설계하기: Tensor Core GEMM, 융합 소프트맥스, FlashAttention, 자동 튜닝

Designing High-Performance GPU Kernels with TileLang: Tensor-Core GEMM, Fused Softmax, FlashAttention, and Autotuning

TL;DR AI

핵심 요약

1분
  1. TileLang과 TVM을 활용해 벡터 더하기부터 텐서코어 GEMM, fused epilogue, 행 단위 softmax, FlashAttention까지 GPU 커널을 작성하고 벤치마크하는 튜토리얼이 소개됐다.

  2. 이 튜토리얼은 PyTorch와 cuBLAS와의 성능 비교를 통해, 고수준 DSL로도 CUDA 수준의 고성능을 노릴 수 있음을 보여준다.

  3. 또한 서로 다른 GPU에 맞춰 커널 스케줄을 자동 튜닝해, 수동 저수준 최적화 부담을 줄이면서 성능을 끌어올리는 방법을 다룬다.

원문 보기