PAPER·yesterdayChimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion TransformersHugging Face Papers
PAPER·3 days agoWorldDiT: A Unified Diffusion Architecture for World and Action ModelingHugging Face Papers
PAPER·3 days agoSol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention SparsificationHugging Face Papers
PAPER·3 days agoMemory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion TransformersApple Machine Learning Research
PAPER·July 24, 2026TRaM-VSR: Importance-Aware Token Routing and Merging for One-Step Diffusion Video Super-ResolutionarXiv
PAPER·July 24, 2026SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video GenerationHugging Face Papers
PAPER·June 1, 2026Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion TransformerHugging Face Papers
PAPER·June 1, 2026SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion TransformerHugging Face Papers
PAPER·May 28, 2026GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-PreserverarXiv
PAPER·May 27, 2026RT-Lynx: Putting GEMM Sparsity in the Right Way for Diffusion ModelsHugging Face Papers
PAPER·May 25, 2026Rethinking Cross-Layer Information Routing in Diffusion TransformersHugging Face Papers