RoboSemanticBench: VLA 모델의 행동 예측에서 의미론적 그라운딩 진단
RoboSemanticBench: Diagnosing Semantic Grounding in Action Prediction for VLA Models
TL;DR AI
1분핵심 요약
연구진은 로봇이 수학·상식 객관식 질문의 정답이 적힌 블록을 집어 선택하게 하는 체화형 벤치마크 RoboSemanticBench를 공개했다.
대표적인 비전-언어-행동(VLA) 모델들을 평가한 결과, 많은 로봇이 물체를 집는 데는 성공했지만, 그중 의미적으로 올바른 블록을 고르는 비율은 거의 무작위 수준이거나 더 낮았다.
이는 사전학습된 언어 지식과 로봇의 행동 예측 사이에 큰 간극이 있음을 보여준다.
RoboSemanticBench는 로봇이 집기는 잘해도, 지시문의 의미를 올바른 대상 선택으로 연결하지 못하는 semantic grounding 약점을 드러낸다.