VisualThink-VLA: 효과적이고 저지연인 비전-언어-행동 정책을 위한 시각 중간 추론
VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies
TL;DR AI
1분핵심 요약
VisualThink-VLA는 텍스트 chain-of-thought 대신 압축된 시각 중간 추론을 도입해, 공간 정보를 보존하면서도 오버헤드를 줄입니다.
선택적 라우팅과 시각 증거 검증으로 정합성과 효율성을 함께 높였으며, 이를 위해 VisualEvidence-Kit 데이터셋도 공개했습니다.
이 시스템은 대부분의 벤치마크에서 최고 수준의 성공률을 기록했고, 로봇 제어 추론 속도를 크게 개선했습니다.
BridgeData V2에서는 지연 시간이 8.377초에서 0.367초로 줄어들어, 추론이 포함된 VLA 정책의 실시간 활용성이 크게 향상됐습니다.
