PAPER·yesterdaySol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention SparsificationHugging Face Papers
PAPER·6 days agoFlash EQ-Linear: Accelerating Equivariant Linear Layers via Group-wise Discrete Fourier TransformarXiv
PAPER·June 2, 2026From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM CompressionarXiv
PAPER·May 21, 2026Mix-Quant: Quantized Prefilling, Precise Decoding for Agentic LLMsHugging Face Papers
PAPER·May 19, 2026SNLP: Layer-Parallel Inference via Structured Newton CorrectionsHugging Face Papers
PAPER·May 14, 2026Orthus: Memory-Efficient Parallel Token Generation via Dual-View DiffusionHugging Face Papers
PAPER·May 12, 2026SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative DecodingHugging Face Papers
PAPER·May 6, 2026SpecMD: A Comprehensive Study on Speculative Expert PrefetchingApple Machine Learning Research
PAPER·April 3, 2026PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive CodingHugging Face Papers