언어 바꾸기English
이전 목록

VisualThink-VLA: 효과적이고 저지연인 비전-언어-행동 정책을 위한 시각 중간 추론

VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies

TL;DR AI

핵심 요약

1분
  1. VisualThink-VLA는 텍스트 chain-of-thought 대신 압축된 시각 중간 추론을 도입해, 공간 정보를 보존하면서도 오버헤드를 줄입니다.

  2. 선택적 라우팅과 시각 증거 검증으로 정합성과 효율성을 함께 높였으며, 이를 위해 VisualEvidence-Kit 데이터셋도 공개했습니다.

  3. 이 시스템은 대부분의 벤치마크에서 최고 수준의 성공률을 기록했고, 로봇 제어 추론 속도를 크게 개선했습니다.

  4. BridgeData V2에서는 지연 시간이 8.377초에서 0.367초로 줄어들어, 추론이 포함된 VLA 정책의 실시간 활용성이 크게 향상됐습니다.

원문 보기