언어 바꾸기English
이전 목록

생성을 위한 네이티브 오디오-비주얼 정렬

Native Audio-Visual Alignment for Generation

TL;DR AI

핵심 요약

1분
  1. 연구진이 공동 오디오-비디오 생성을 위한 네이티브 오디오-비주얼 정렬 프레임워크 NAVA를 공개했다.

  2. NAVA는 Align-then-Fuse MMDiT 구조로 먼저 오디오와 비디오를 정렬한 뒤, 문맥 조건부 디노이징을 적용해 동기화와 제어성을 높인다.

  3. Timbre-in-Context Conditioning으로 참고 신호에 맞는 음색을 더 정확하게 반영한다.

  4. Verse-Bench와 Seed-TTS 테스트에서 63억 파라미터 규모로 더 강한 동기화, 경쟁력 있는 음질, 향상된 제어성을 보였다.

원문 보기