Vision-TL-Action: 시각 관찰과 시간 논리로부터의 뉴로심볼릭 궤적 생성
Vision-TL-Action: Neuro-Symbolic Trajectory Generation from Visual Observations and Temporal Logic

TL;DR AI
1분핵심 요약
연구진은 다중 시점 이미지와 시계열 논리 목표로 로봇 궤적을 생성하는 신경-기호 모델 Vision-TL-Action을 제안했다.
이 시스템은 작업 토큰, 시각 토큰, 로봇의 초기 상태를 양방향 크로스어텐션과 플로우 매칭 생성기로 결합한다.
학습 단계 전용 grounding loss를 통해 추론 시 객체 기하 정보 없이도 관측을 구조화된 작업 목표로 매핑한다.
Panda에서는 oracle-state 기준선을 능가했고, AntMaze에서는 이에 근접했으며, ablation 결과 의미적 grounding의 중요성이 확인됐다.
