언어 바꾸기English
이전 목록

자원 제약이 있는 에이전틱 LLM 포스트 트레이닝을 위한 협력적 공진화

Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training

TL;DR AI

핵심 요약

1분
  1. 연구진은 도구 사용형 LLM 에이전트의 후훈련을 위해 메모리 사용을 크게 줄인 협력적 파라미터 부분공간 진화 전략 CoPES를 제안했다.

  2. Qwen3.5-4B의 수학·질의응답 벤치마크에서 CoPES는 같은 GPU 시간 예산으로 전체 파라미터 GRPO의 검증 성능 향상을 대부분 회복했다.

  3. 또한 CoPES는 일반적인 진화 전략과 LoRA 기반 GRPO보다 pass@k 성능이 더 좋아, 품질 저하를 크게 겪지 않으면서 효율을 높였다.

  4. 이 방법은 계산 자원과 메모리가 제한된 환경에서 에이전틱 LLM을 학습시키는 실용적인 해법을 제시한다.

원문 보기