언어 바꾸기English
이전 목록

AI 모델은 인간이 설계한 빌딩 블록 없이 로봇 제어에 실패하지만 에이전트식 스캐폴딩이 격차를 줄인다

AI models fail at robot control without human-designed building blocks but agentic scaffolding closes the gap

TL;DR AI

핵심 요약

2분
  1. CaP-X는 Nvidia, UC Berkeley, Stanford, Carnegie Mellon 연구진이 공개한 프레임워크로, AI 코딩 에이전트가 자체 작성한 프로그램으로 로봇을 제어하는 능력을 체계적으로 평가한다.

  2. 연구진은 12개의 최첨단 모델(예: Gemini-3-Pro, GPT-5.2, Claude Opus 4.5, Qwen3-235B, DeepSeek-V3.1)을 7개의 조작 과제에서 테스트했으며, 한 번의 시도로 인간이 작성한 프로그램의 신뢰성에 맞춘 모델은 없었다.

  3. 핵심 아이디어는 로봇 전용 모션 데이터로 학습된 모델을 쓰는 대신 범용 언어 모델이 제어 코드를 생성하게 하는 것이다.

  4. 적용된 기법으로는 물리 시뮬레이션에서 검증 가능한 보상을 쓰는 강화학습, 병렬 해법 생성과 자체 수정 같은 테스트 시 컴퓨팅 확장, 자동 디버깅 및 재사용 가능한 함수 축적 같은 에이전트적 패턴이 있다.

  5. 미리 만들어진 명령이 주어지면 성능이 향상되지만 이미지 분할·깊이 처리·그립 계획·역기구학 같은 저수준 단계로 대체하거나 원시 카메라 이미지를 직접 맥락으로 제공하면 성공률이 떨어지며, 이는 다중모달 모델의 동시 추론 훈련 부족과 교차모달 정렬 문제와 관련된다.

원문 보기