ThriftAttention: 긴 컨텍스트 FP4 어텐션을 위한 선택적 혼합 정밀도
ThriftAttention: Selective Mixed Precision for Long-Context FP4 Attention
TL;DR AI
1분핵심 요약
ThriftAttention은 긴 문맥 추론을 위한 2단계 혼합 정밀도 어텐션 방식입니다.
중요한 일부 query-key 블록 쌍만 FP16으로 계산하고, 나머지는 FP4로 처리합니다.
전체 블록의 약 5%만 FP16으로 바꿔도 FP4와 FP16 사이의 성능 차이를 상당 부분 회복했으며, 긴 시퀀스에서 특히 효과적이었습니다.
두 경로는 온라인 소프트맥스로 합쳐지며, 다양한 모델과 벤치마크에서 추가 오버헤드는 작았습니다.
이를 통해 저비트 긴 문맥 모델을 더 빠르고 저렴하게, 그리고 더 높은 품질로 운용할 수 있습니다.
