다양한 시나리오에서의 장문 음성 생성 종합 벤치마킹
Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios
TL;DR AI
1분핵심 요약
연구진은 17가지 현실적 시나리오를 아우르는 장문 음성·대화 생성 벤치마크 Swanbench-Speech를 제안했다.
이 벤치마크는 1,101개 샘플과 7개 자동 평가 지표로 음향, 의미, 표현력을 다각도로 측정한다.
실험 결과, 현존 음성 모델들은 감정 표현, 일관성 유지, 계층적 구조 보존에서 여전히 약점을 보였다.
이 벤치마크는 장문 음성의 품질을 더 신뢰성 있게 평가할 수 있도록 돕는다.
