언어 바꾸기English
이전 목록

‘표현력 격차’를 좁히다: Mistral의 Voxtral TTS가 하이브리드 자기회귀 및 플로우 매칭 아키텍처로 다국어 음성 클로닝을 재정의하는 방법

Closing the ‘Expressivity Gap’: How Mistral’s Voxtral TTS is Redefining Multilingual Voice Cloning with a Hybrid Autoregressive and Flow-Matching Architecture

TL;DR AI

핵심 요약

1분
  1. Mistral AI가 첫 TTS 모델인 Voxtral TTS를 오픈 웨이트와 API 형태로 공개했다.

  2. 이 모델은 오토리그레시브 디코더, 플로우 매칭 음향 모델, 전용 코덱을 결합해 짧은 참고 음성만으로 9개 언어의 음성을 생성한다.

  3. Mistral은 Voxtral TTS가 화자 유사도와 표현력이 뛰어나며, 단일 NVIDIA H200에서 낮은 지연시간으로 구동된다고 밝혔다.

  4. 이번 출시는 일관되고 자연스러운 목소리가 중요한 음성 에이전트, 오디오북, 다국어 서비스의 개선을 겨냥한다.

원문 보기