Alibaba Qwen 팀, Qwen3.5 Omni 출시: 텍스트·오디오·비디오 및 실시간 상호작용을 위한 네이티브 멀티모달 모델
Alibaba Qwen Team Releases Qwen3.5 Omni: A Native Multimodal Model for Text, Audio, Video, and Realtime Interaction

TL;DR AI
1분핵심 요약
Qwen3.5-Omni는 Thinker-Talker 아키텍처를 사용한다.
네이티브 Audio Transformer(AuT) 인코더를 포함하며, AuT는 1억 시간(100 million hours) 이상의 오디오-비주얼 데이터로 사전학습되었다.
Thinker와 Talker 모두 Hybrid-Attention Mixture-of-Experts(MoE)를 활용한다.
아키텍처는 256k 장기 컨텍스트를 지원하며 연속 오디오를 10시간 이상 수용할 수 있다.
기사에서는 오디오/비디오와 관련해 "400초 이상"을 언급하지만 해당 문장이 불완전해 자세한 내용은 제공되지 않았다.



