PyTorch에서 프로파일링하기(3부): Attention is all you profile
Profiling in PyTorch (Part 3): Attention is all you profile
TL;DR AI
1분핵심 요약
이 프로파일링 글은 PyTorch의 단순 causal attention을 살펴보고, 각 단계가 프로파일러 추적과 GPU 커널에 어떻게 나타나는지 보여준다.
트레이스에서는 matmul, 스케일링, 마스킹, softmax, 최종 value projection 같은 핵심 연산이 드러난다.
이어서 더 최적화된 attention 변형들을 소개하며 실행 패턴이 어떻게 달라지는지 비교한다.
핵심은 attention이 Transformer 성능의 주요 병목이며, 프로파일링을 통해 어디서 커널 호출과 시간이 줄어드는지 확인할 수 있다는 점이다.
