실제 업무에서 우리의 모델 성능 측정하기
Measuring the performance of our models on real-world tasks

TL;DR AI
1분핵심 요약
OpenAI가 44개 직업과 미국 GDP 기여 9개 주요 산업의 현실적인 지식노동 과제를 바탕으로 한 AI 평가인 GDPval을 공개했다.
이 벤치마크는 총 1,320개 과제로 구성되며, 이 중 220개 골드 과제가 오픈소스로 공개됐고 보고서, 도표, 스프레드시트, 슬라이드, 멀티미디어 같은 산출물을 평가한다.
GDPval은 학술형 벤치마크가 아니라 경제적 가치가 있는 실제 업무 수행 능력을 측정해, AI의 실용성을 더 명확히 보여주려는 목적을 갖는다.
이를 통해 모델이 일상적인 전문 업무 흐름을 얼마나 잘 처리하는지 근거 중심으로 판단할 수 있게 한다.



