DINOde: 오픈 보캐뷸러리 의미론적 분할을 위한 연속적 비전-텍스트 정렬
DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation

TL;DR AI
1분핵심 요약
연구진은 오픈보캐뮬러리 의미론적 분할을 위한 연속적 비전-텍스트 정렬 프레임워크 DINOde를 제안했다.
이 방법은 Semantic Text Flow와 Global Context Flow를 통해 CLIP 텍스트 임베딩과 전역 이미지 특징을 DINO의 시각 공간으로 매핑한다.
또한 접공간 제약을 활용해 초구 기하를 보존하고, 교차모달 정합성을 높였다.
DINOde는 OVSS 벤치마크에서 최고 성능을 기록하며, 보지 못한 카테고리 인식 능력을 강화했다.