HumanCLAW: 비전-언어 모델은 몸을 통해 행동할 수 있는가?
HumanCLAW: Can Vision-Language Models Act Through a Body?
TL;DR AI
1분핵심 요약
연구진은 비전-언어 모델의 명령을 짧은 전신 동작 단위로 바꿔, 몸을 가진 에이전트의 제어 능력을 평가하는 HumanCLAW를 제안했다.
또한 41개 장면의 1,218개 1인칭 실내 에피소드로 구성된 HumanCLAW-Bench를 구축해 실제 물리적 의사결정을 시험했다.
9개의 주요 VLM을 평가한 결과, 어떤 모델도 벤치마크를 해결하지 못했으며 최고 성능도 성공률 16.8%에 그쳤다.
주요 실패 원인은 목표 인식보다 자기 몸에 대한 인지와 장기 과제에서의 신체 추적 능력 부족이었다.
