언어 바꾸기English
이전 목록

자기회귀 확산 트랜스포머를 통한 스트리밍 동기화 공간 오디오 생성

Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

TL;DR AI

핵심 요약

1분
  1. 연구진은 파노라마 영상과 텍스트 프롬프트로부터 고품질 공간 오디오를 생성하는 통합 스트리밍 시스템 SwanSphere를 공개했다.

  2. 이 시스템은 causal autoregressive diffusion transformer, spatial video-audio contrastive learning, 온라인 direct preference optimization, 자동 공간 캡션 생성 파이프라인을 결합한다.

  3. 테스트에서 영상→공간 오디오와 텍스트→공간 오디오 모두에서 성능이 향상됐다.

  4. SwanSphere는 지연을 줄이면서 멀티모달 정합성과 공간 정확도를 높여 몰입형 미디어와 AI 오디오 시스템에 의미가 있다.

원문 보기