픽셀에서 단어로 -- 대규모 네이티브 원비전 모델을 향하여
From Pixels to Words -- Towards Native One-Vision Models at Scale
TL;DR AI
1분핵심 요약
연구진은 NEO-ov라는 네이티브 비전-언어 파운데이션 모델을 제안했으며, 픽셀-단어와 프레임 간 관계를 종단 간으로 학습한다.
이 모델은 모듈식 인코더와 융합 컴포넌트를 제거하고, 입력 스트림에서 픽셀과 단어를 직접 정렬한다.
NEO-ov는 세밀한 시각 인식에서 강한 성능을 보였고, 여러 벤치마크에서 모듈식 시스템과 거의 비슷한 수준을 기록했다.
논문은 또한 확장 가능한 통합 멀티모달 모델을 위한 아키텍처 분석과 학습 지침을 제시한다.
