OpenAI가 "AI의 능력은 제대로 측정되지 않고 있을 가능성이 있다"고 주장
OpenAI claims that "AI capabilities may not be being measured correctly"

TL;DR AI
1분핵심 요약
OpenAI는 프론티어 모델의 제3자 평가를 위한 플레이북을 공개하며, 모델뿐 아니라 하네스·도구·예산·공격 조건까지 함께 설계해야 한다고 강조했다.
보상 해킹, 답변 거부, 데이터 오염, 깨진 문제, 전략적 손풀기 같은 요인이 벤치마크 결과를 왜곡할 수 있다고 경고했다.
AI가 도구 사용과 다단계 작업을 수행하게 되면서, 능력과 안전성을 제대로 재려면 더 정교한 평가 기준이 필요하다고 밝혔다.
이번 가이드는 GPT-5.5, GPT-5.4, Codex 같은 모델에 대해 기존 단순 테스트의 한계를 드러내며 평가 표준화의 필요성을 부각한다.



