언어 바꾸기English
이전 목록

LLaVA-OneVision-2: 차세대 지각 지능을 향하여

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

TL;DR AI

핵심 요약

1분
  1. 연구진이 다중모달 인식을 위한 차세대 비전-언어 모델 LLaVA-OneVision-2를 공개했다.

  2. 이 모델은 codec-stream tokenization, windowed attention, 공유 3D 위치 인코딩을 활용해 긴 영상과 공간 입력을 더 잘 처리한다.

  3. 수백만 건의 공개 영상·공간 샘플로 학습돼 영상 이해, 그라운딩, 트래킹 벤치마크에서 큰 성과를 냈다.

  4. 세밀한 시간적 위치 파악과 영상·공간 과제 전반의 통합 성능을 개선하며, 선도 경쟁 모델보다 우수한 결과를 보였다.

원문 보기