PAPER·21 hours agoWorldDiT: A Unified Diffusion Architecture for World and Action ModelingHugging Face Papers
PAPER·yesterdaySol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention SparsificationHugging Face Papers
PAPER·yesterdayMemory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion TransformersApple Machine Learning Research
PAPER·5 days agoTRaM-VSR: Importance-Aware Token Routing and Merging for One-Step Diffusion Video Super-ResolutionarXiv
PAPER·June 1, 2026Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion TransformerHugging Face Papers
PAPER·June 1, 2026SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion TransformerHugging Face Papers
PAPER·May 28, 2026GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-PreserverarXiv
PAPER·May 27, 2026RT-Lynx: Putting GEMM Sparsity in the Right Way for Diffusion ModelsHugging Face Papers
PAPER·May 25, 2026Rethinking Cross-Layer Information Routing in Diffusion TransformersHugging Face Papers
PAPER·May 22, 2026SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion TransformersHugging Face Papers
PAPER·May 22, 2026RiT: Vanilla Diffusion Transformers Suffice in Representation SpaceHugging Face Papers