Nous Research, 긴 컨텍스트에서 사전학습 속도를 1.4~1.7배 높이는 학습 전용 선택 기반 계층적 어텐션 ‘Lighthouse Attention’ 제안
Nous Research Proposes Lighthouse Attention: A Training-Only Selection-Based Hierarchical Attention That Delivers 1.4–1.7× Pretraining Speedup at Long Context

TL;DR AI
1분핵심 요약
Nous Research가 긴 컨텍스트 모델용 학습 전용 계층형 희소 어텐션 기법인 Lighthouse Attention을 공개했다.
이 방법은 쿼리·키·밸류를 다층 피라미드로 압축한 뒤, 어텐션 커널 밖에서 일부 토큰을 선택하고 표준 FlashAttention을 적용한다.
cuDNN 기반 SDPA 기준선과 비교해 사전학습 속도가 1.40배에서 1.69배까지 빨라졌다.
최종 학습 손실은 비슷하거나 더 낮아, 속도 향상이 모델 품질 저하 없이 가능함을 보여준다.
