멀티헤드 어텐션 잔차
Multi-Head Attention Residuals
TL;DR AI
1분핵심 요약
연구진이 Multi-Head Attention Residuals(MHAR)를 제안해, Transformer의 residual routing에서 여러 헤드가 서로 다른 depth history를 보도록 설계했다.
MHAR는 표준 Transformer보다 1억, 3.5억, 10억 파라미터 규모에서 검증 손실이 더 낮았고, H=4 또는 H=8에서 가장 좋은 성능을 보였다.
이 방식은 추가 파라미터가 없고 계산 오버헤드도 거의 없으며, 학습 중간에 전환해도 GSM8K와 GPQA 성능 향상을 확인했다.
또한 fused Triton 커널로 학습 처리량을 높이면서 메모리 사용은 거의 기존 수준으로 유지했다.
