VLA 초기화를 위한 VLM 표현 재고
Rethinking VLM Representation for VLA Initialization
TL;DR AI
1분핵심 요약
이 연구는 사전학습된 비전-언어 모델(VLM)로부터 비전-언어-행동(VLA) 모델을 어떻게 초기화할지 살펴봤습니다.
가장 중요한 것은 사전학습된 VLM 표현을 유지하는 것이었고, 여기에 embodied VQA 감독과 로봇 데이터 사전학습이 추가로 도움이 됐습니다.
LoRA는 전체 파인튜닝보다 더 안정적인 초기화를 제공했으며, 단계적으로 진행한 LoRA 기반 로봇 사전학습이 가장 좋은 성과를 냈습니다.
이번 결과는 멀티모달 사전학습 모델로 더 강력한 로봇 정책을 만드는 데 실질적인 지침을 제공합니다.
