언어 바꾸기English
이전 목록

LatentOmni: 통합 오디오-비주얼 잠재 추론을 통한 옴니모달 이해의 재고

LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

TL;DR AI

핵심 요약

2분
  1. 연구진은 텍스트와 오디오-비주얼 잠재 상태를 교차로 결합하는 크로스모달 추론 프레임워크 LatentOmni를 제안했다.

  2. 이 방법은 feature-level supervision과 temporal consistency embedding을 추가해, 모달리티 전반의 미세한 증거를 더 잘 보존한다.

  3. Omni-Sync Position Embedding, LatentOmni-Instruct-35K 같은 구성요소와 함께, 여러 벤치마크에서 명시적 텍스트 기반 chain-of-thought보다 더 좋은 성능을 보였다.

  4. 이번 결과는 잠재 공간에서 추론을 유지하는 방식이 temporal grounding과 멀티모달 LLM 성능을 높일 수 있음을 시사한다.

원문 보기