Switch language한국어
Back to the list

Nous Research Proposes Lighthouse Attention: A Training-Only Selection-Based Hierarchical Attention That Delivers 1.4–1.7× Pretraining Speedup at Long Context

TL;DR AI

Key summary

2 min read
  1. Nous Research introduced Lighthouse Attention, a training-only hierarchical sparse attention method for long-context models.

  2. It pools queries, keys, and values into a multi-level pyramid, then selects a subset outside the attention kernel before running standard FlashAttention.

  3. Against a cuDNN-backed SDPA baseline, it delivered 1.40× to 1.69× faster pretraining.

  4. Final training loss was similar or lower, suggesting the speedup does not sacrifice model quality.

Read the original