CosyEdit2: 음성 편집 지향 강화학습으로 더 나은 제로샷 TTS 구현
CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS

TL;DR AI
1분핵심 요약
연구진은 음성 편집을 위한 2단계 후학습 방법인 CosyEdit2를 공개했다.
먼저 지도학습 기반 편집 훈련을 하고, 이후 타깃 음성이 없는 데이터에 편집 중심 GRPO를 적용한다.
이 방식은 음성 편집 성능을 높이는 동시에 제로샷 TTS 품질도 개선했다.
이번 결과는 음성 편집 최적화와 제로샷 TTS가 생각보다 더 밀접하게 연결돼 있음을 시사한다.
