언어 바꾸기English
이전 목록

AgiBot WITA-Omni 풀모달 모델, DailyOmni 글로벌 리더보드 1위: 구글 Gemini, ByteDance Doubao, Alibaba Qwen 제치고 체화형 크로스모달 이해 성능 입증

AgiBot WITA-Omni Full-Modal Model Tops DailyOmni Global Leaderboard: Beating Google Gemini, ByteDance Doubao, and Alibaba Qwen at Embodied Cross-Modal Understanding

TL;DR AI

핵심 요약

1분
  1. AgiBot의 WITA-Omni Preview가 DailyOmni 벤치마크에서 85.21점을 받아 전체 1위를 차지했다.

  2. 음성-영상 정렬, 시간적 추론, 장시간 영상 이해 등 8개 지표 중 6개에서 선두를 기록했다.

  3. 이 모델은 Thinker-Talker-Actor 구조로 추론·음성·행동 생성을 병렬 처리해 로봇의 말, 제스처, 표정을 실시간으로 더 잘 맞춘다.

  4. 이번 성과는 실제 상호작용에 최적화된 embodied AI가 범용 멀티모달 모델보다 로봇에 더 중요한 과제에서 강할 수 있음을 보여준다.

원문 보기