텐센트 AI, 실시간 오디오 대화·추론용 7B 음성 언어 모델 Covo-Audio 오픈소스 공개
Tencent AI Open Sources Covo-Audio: A 7B Speech Language Model and Inference Pipeline for Real-Time Audio Conversations and Reasoning

TL;DR AI
2분핵심 요약
Covo-Audio 오픈소스로 발표되었다 7B 파라미터의 종단간 대규모 음성 언어 모델로 공개됨.
Audio Encoder Whisper-large-v3를 기본 인코더로 사용한다, whisper-large-v3를 사용하며 프레임 레이트는 50Hz이다.
Audio Adapter 프레임 레이트를 6.25Hz로 다운샘플링한다 세 개의 다운샘플 모듈로 프레임 레이트를 50Hz에서 6.25Hz로 낮춘다.
LLM Backbone Qwen2.5-7B-Base를 백본으로 사용한다, qwen2.5-7B-Base를 기반으로 연속 음향 특징과 텍스트 토큰의 교차 시퀀스를 처리하도록 적응됨.
Speech Tokenizer 코드북 크기 16,384로 25Hz 토큰을 생성한다, wavLM-large 기반의 코드북 크기는 16,384이며 25Hz로 이산 오디오 토큰을 생성한다.



