본문으로 건너뛰기
트렌드 검색
검색
언어 바꾸기
English
“vision-language models” 검색 결과
카테고리 설정
인기
최신
테크
코딩
사이언스
게이밍
영상
투자
논문
하드웨어
검색된 기사
제목
요약
태그
날짜
적용
논문
·
2026년 6월 2일
HakushoBench: 일본 정부 백서 기반 차트 및 표 VQA 벤치마크
Hugging Face Papers
논문
·
2026년 6월 2일
VLM은 적응형 테스트 시간 최적화를 통해 비디오 추론을 가르치는 좋은 교사다
arXiv
논문
·
2026년 6월 2일
비둘기처럼 능동적으로 탐색하기: 에이전트형 비전-언어 모델을 통한 공간 추론 강화
arXiv
논문
·
2026년 6월 1일
평면 조립 벤치: 가구 조립을 통한 대규모 비전-언어 모델의 시공간 이해 평가
Hugging Face Papers
논문
·
2026년 6월 1일
보는 것이 아는 것은 아니다: VLM은 언제 공간 질문에 답하지 말아야 하는지(그리고 왜인지) 알고 있는가?
Hugging Face Papers
논문
·
2026년 6월 1일
긴 영상 이해를 위한 선형 확장 비디오 VLM
Hugging Face Papers
논문
·
2026년 6월 1일
VLM3: 비전-언어 모델은 본질적으로 3D 학습자다
Hugging Face Papers
논문
·
2026년 5월 30일
3D VQA를 넘어: 향상된 기하 추론을 위해 비전-언어 모델에 3D 공간 사전 지식 주입
Hugging Face Papers
논문
·
2026년 5월 30일
Why Far Looks Up: 비전-언어 모델의 공간 표현 탐구
Hugging Face Papers
논문
·
2026년 5월 29일
미세한 시각적 차이에서 배우기: 문맥 내 시각 대조 최적화를 통한 멀티모달 환각 완화
arXiv
논문
·
2026년 5월 29일
LoMo: 더 깊은 비전-언어 융합을 위한 로컬 모달리티 치환
Hugging Face Papers
논문
·
2026년 5월 29일
무엇을, 어떻게 상상할까? 크로스뷰 공간 추론을 위한 통합 멀티모달 모델의 시각적 사고
Hugging Face Papers
이전
2페이지
다음
트렌드
대시보드
리포트