AstraFlow: 에이전틱 LLM을 위한 데이터플로우 지향 강화학습
AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs
TL;DR AI
1분핵심 요약
연구진은 agentic LLM용 데이터플로우 기반 RL 시스템 AstraFlow를 제안했으며, rollout·데이터플로우 관리·학습을 독립된 구성요소로 분리했다.
이 설계는 시스템 코드 수정 없이 멀티-정책 학습, 탄력적 스케일링, 이기종·크로스리전 실행을 지원한다.
수학, 코딩, 검색, AgentBench 벤치마크에서 기존 시스템과 같거나 더 나은 성능을 보였고, 학습 시간은 2.7배 단축됐다.
AstraFlow는 혼합 컴퓨팅 자원을 활용하는 대규모 LLM 에이전트 RL의 개발 부담을 줄이고 확장성을 높이는 것을 목표로 한다.
