VLM3: 비전-언어 모델은 본질적으로 3D 학습자다
VLM3: Vision Language Models Are Native 3D Learners
TL;DR AI
1분핵심 요약
VLM3는 일반적인 비전-언어 모델을 여러 3D 작업에 맞게 적응시킬 수 있음을 보여줍니다.
초점거리 통일, 텍스트 기반 픽셀 참조, 확장된 데이터 혼합을 통해 깊이 추정, 픽셀 대응, 카메라 자세, 객체 수준 3D 이해를 수행합니다.
이 시스템은 특화된 비전 모델과 비슷한 성능을 내면서도 작업별 변경과 복잡한 학습 파이프라인을 줄일 수 있습니다.
