DRScaffold: 경량 비전-언어 모델에서 밀집 장면 추론을 향상시키는 방법
DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models

TL;DR AI
1분핵심 요약
연구진은 2,943개 이미지와 14,573개 질문으로 구성된 DRBench를 공개해 밀집 장면 추론 능력을 평가할 수 있게 했다.
또한 DRScaffold라는 4단계 지도 미세조정 방법을 제안해 경량 VLM이 근거를 바탕으로 추론하도록 만들었다.
이 방식은 일반 벤치마크 성능 저하를 거의 유발하지 않으면서 밀집 장면 작업에서 큰 성능 향상을 보였다.
특히 더 작은 튜닝 모델이 새 벤치마크에서 훨씬 큰 고정 모델을 능가할 수 있음을 보여줬다.
