대규모 멀티모달 모델에서 창의적 물리 지능 발전
Advancing Creative Physical Intelligence in Large Multimodal Models
TL;DR AI
1분핵심 요약
연구진은 시각적으로 풍부하고 물리적으로 제약된 장면에서 멀티모달 모델의 창의적 도구 사용 능력을 평가하는 MM-CreativityBench를 제안했다.
벤치마크 결과, 현재 모델들은 관련 물체를 놓치거나 장면을 충분히 살피지 못하고, 객체 속성을 환각하는 경우가 많았다.
이를 해결하기 위해 선호도 최적화와 어포던스(affordance) 감독을 결합한 affordance-grounded alignment를 도입했다.
이 학습 방식은 근거 있는 탐색을 강화하고 창의적 시각 문제 해결에서 환각을 줄이는 데 도움을 준다.
