언어 바꾸기English
이전 목록

NVIDIA AI, ProRL Agent 공개: 대규모 다중턴 LLM 에이전트 강화학습을 위한 분리형 Rollout-as-a-Service 인프라

NVIDIA AI Unveils ProRL Agent: A Decoupled Rollout-as-a-Service Infrastructure for Reinforcement Learning of Multi-Turn LLM Agents at Scale

TL;DR AI

핵심 요약

2분
  1. nVIDIA 연구진이 다중 회차 LLM 에이전트의 강화학습(RL) 훈련을 위한 확장 가능한 인프라인 ProRL AGENT를 소개했다.

  2. Rollout-as-a-Service 설계는 롤아웃 오케스트레이션을 학습 루프에서 분리하고, I/O 집약적 환경 상호작용과 GPU 집약적 정책 업데이트 사이의 자원 충돌을 해소한다.

  3. ProRL AGENT는 전체 롤아웃 수명주기를 관리하는 독립적인 HTTP 서비스로 동작하며 RL 트레이너는 API를 통해 상호작용한다.

  4. 세 단계 비동기 파이프라인(INIT, RUN, EVAL)은 작업을 중첩해 처리량을 극대화한다: INIT은 샌드박스 컨테이너와 도구를 초기화하고, RUN은 다중 회차 에이전트 루프를 구동하며 궤적을 수집하고, EVAL은 정답과 비교해 보상 신호를 산출한다.

  5. 시스템은 샌드박싱과 루트리스 실행을 위해 Singularity를 사용한다.

원문 보기