언어 바꾸기English
이전 목록

SwanVoice: 독백과 대화 모두를 위한 표현력 있는 장문 제로샷 음성 합성

SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue

TL;DR AI

핵심 요약

1분
  1. 연구진이 1~4화자 음성을 다루는 제로샷 TTS 파이프라인 SwanData-Speech와 SwanVoice를 공개했다.

  2. 이 시스템은 휴지기 인식 텍스트 조건화, VAE, flow-matching DiT, diffusion 기반 후학습을 결합해 긴 형식의 표현력 있는 음성을 개선한다.

  3. SwanBench-Speech 평가에서 오픈소스 기준선보다 풍부함과 계층성 측면에서 더 좋은 성능을 보였고, 특히 독백과 대화 생성에서 강점을 보였다.

  4. 다만 내용 정확도는 여전히 개선 여지가 있지만, 일관되고 감정 연속성이 있는 다중 화자 음성 합성의 진전을 보여준다.

원문 보기