Paper·July 30, 2026ReToken: One Token to Improve Vision-Language Models for Visual RetrievalHugging Face Papers
Paper·May 22, 2026Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training StepsHugging Face Papers
Paper·May 21, 2026OCTOPUS: Optimized KV Cache for Transformers via Octahedral Parametrization Under Optimal Squared Error QuantizationHugging Face Papers
Paper·May 21, 2026OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and BeyondHugging Face Papers