VIP: 효율적인 밀집 비전-언어 추론을 위한 시각 유도 프롬프트 진화
VIP: Visual-guided Prompt Evolution for Efficient Dense Vision-Language Inference

TL;DR AI
1분핵심 요약
연구진은 학습 없이 동작하는 VIP를 제안해 오픈 보캐브러리 의미론적 분할을 개선했다.
VIP는 CLIP 기반 방법을 넘어, 공간 인식이 가능한 비전-언어 모델로 밀집 예측을 수행한다.
시각적 단서를 활용해 모호한 텍스트 질의를 정제하며, visual-guided prompt evolution과 alias expansion을 적용한다.
이 방식은 추가 추론 비용이 낮으면서도 정확도와 일반화 성능을 높인다.
