언어 바꾸기English
이전 목록

Qwen3.5-Omni는 누구에게도 학습되지 않고 음성 지시와 영상만으로 코드를 작성하는 법을 배웠다

Qwen3.5-Omni learned to write code from spoken instructions and video without anyone training it to

TL;DR AI

핵심 요약

2분
  1. Alibaba가 Qwen3.5-Omni를 공개했으며 이 모델은 텍스트, 이미지, 오디오, 비디오를 처리하는 옴니모달 모델이다.

  2. Qwen3.5-Omni-Plus는 215개 오디오 벤치마크, 215개 시청각 서브태스크, 5개 오디오 벤치마크, 8개 음성인식 벤치마크, 156개 언어별 번역 과제, 43개 언어별 인식 과제 등에서 최고 성능을 주장한다.

  3. 보고에 따르면 Omni-Plus는 전체 오디오 이해·추론·인식·번역·대화에서 Google의 Gemini 3.1 Pro를 능가한다고 하나, 전체 시청각 이해에서는 Gemini와 동등하다고 한다.

  4. 세부 점수: 오디오 이해(MMAU) 82.2 대 81.1; 음악 이해(RUL-MuchoMusic) 72.4 대 59.6; VoiceBench 대화 93.1 대 88.9.

  5. 음성인식 지원은 현재 74개 언어와 39개 중국어 방언(총 113개 언어·방언)이며, 이전 버전은 11개 언어와 8개 중국어 방언만 다뤘다.

원문 보기