Native Audio-Visual Alignment for Generation
TL;DR AI
2 min readKey summary
Researchers introduced NAVA, a native audio-visual alignment framework for joint audio-video generation.
Its Align-then-Fuse MMDiT design first aligns audio and video, then applies context-conditioned denoising for better sync and control.
Timbre-in-Context Conditioning helps match speech timbre to reference cues more accurately.
On Verse-Bench and Seed-TTS, NAVA delivered stronger synchronization, competitive audio quality, and improved controllability with 6.3B parameters.
