SwanVoice: 독백과 대화 모두를 위한 표현력 있는 장문 제로샷 음성 합성
SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue
TL;DR AI
1분핵심 요약
연구진이 1~4화자 음성을 다루는 제로샷 TTS 파이프라인 SwanData-Speech와 SwanVoice를 공개했다.
이 시스템은 휴지기 인식 텍스트 조건화, VAE, flow-matching DiT, diffusion 기반 후학습을 결합해 긴 형식의 표현력 있는 음성을 개선한다.
SwanBench-Speech 평가에서 오픈소스 기준선보다 풍부함과 계층성 측면에서 더 좋은 성능을 보였고, 특히 독백과 대화 생성에서 강점을 보였다.
다만 내용 정확도는 여전히 개선 여지가 있지만, 일관되고 감정 연속성이 있는 다중 화자 음성 합성의 진전을 보여준다.
