생성을 위한 네이티브 오디오-비주얼 정렬
Native Audio-Visual Alignment for Generation
TL;DR AI
1분핵심 요약
연구진이 공동 오디오-비디오 생성을 위한 네이티브 오디오-비주얼 정렬 프레임워크 NAVA를 공개했다.
NAVA는 Align-then-Fuse MMDiT 구조로 먼저 오디오와 비디오를 정렬한 뒤, 문맥 조건부 디노이징을 적용해 동기화와 제어성을 높인다.
Timbre-in-Context Conditioning으로 참고 신호에 맞는 음색을 더 정확하게 반영한다.
Verse-Bench와 Seed-TTS 테스트에서 63억 파라미터 규모로 더 강한 동기화, 경쟁력 있는 음질, 향상된 제어성을 보였다.
