PlanningBench: 대규모 언어 모델 평가 및 학습을 위한 확장 가능하고 검증 가능한 플래닝 데이터 생성
PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models
TL;DR AI
1분핵심 요약
연구진은 실제 계획 워크플로우를 바탕으로 LLM용 계획 문제를 대규모·다양·검증 가능하게 만드는 taxonomy 기반 프레임워크 PlanningBench를 공개했다.
이 벤치마크는 제약 조건 기반 합성과 자동 검증을 활용해 난이도 조절이 가능한 통제형 계획 데이터를 생성한다.
최신 오픈소스·상용 모델들을 평가한 결과, 복잡한 계획과 지시 준수 능력에는 여전히 개선 여지가 확인됐다.
검증된 예시로 강화학습을 수행하자 계획 과제 성능이 추가로 향상됐다.
