언어 바꾸기English
이전 목록

Alibaba Qwen 팀, Qwen3.5 Omni 출시: 텍스트·오디오·비디오 및 실시간 상호작용을 위한 네이티브 멀티모달 모델

Alibaba Qwen Team Releases Qwen3.5 Omni: A Native Multimodal Model for Text, Audio, Video, and Realtime Interaction

TL;DR AI

핵심 요약

1분
  1. Qwen3.5-Omni는 Thinker-Talker 아키텍처를 사용한다.

  2. 네이티브 Audio Transformer(AuT) 인코더를 포함하며, AuT는 1억 시간(100 million hours) 이상의 오디오-비주얼 데이터로 사전학습되었다.

  3. Thinker와 Talker 모두 Hybrid-Attention Mixture-of-Experts(MoE)를 활용한다.

  4. 아키텍처는 256k 장기 컨텍스트를 지원하며 연속 오디오를 10시간 이상 수용할 수 있다.

  5. 기사에서는 오디오/비디오와 관련해 "400초 이상"을 언급하지만 해당 문장이 불완전해 자세한 내용은 제공되지 않았다.

원문 보기