언어 바꾸기English
이전 목록

ThriftAttention: 긴 컨텍스트 FP4 어텐션을 위한 선택적 혼합 정밀도

ThriftAttention: Selective Mixed Precision for Long-Context FP4 Attention

TL;DR AI

핵심 요약

1분
  1. ThriftAttention은 긴 문맥 추론을 위한 2단계 혼합 정밀도 어텐션 방식입니다.

  2. 중요한 일부 query-key 블록 쌍만 FP16으로 계산하고, 나머지는 FP4로 처리합니다.

  3. 전체 블록의 약 5%만 FP16으로 바꿔도 FP4와 FP16 사이의 성능 차이를 상당 부분 회복했으며, 긴 시퀀스에서 특히 효과적이었습니다.

  4. 두 경로는 온라인 소프트맥스로 합쳐지며, 다양한 모델과 벤치마크에서 추가 오버헤드는 작았습니다.

  5. 이를 통해 저비트 긴 문맥 모델을 더 빠르고 저렴하게, 그리고 더 높은 품질로 운용할 수 있습니다.

원문 보기