언어 바꾸기English
이전 목록

“AI 점수 믿지 마라”…오픈AI가 직접 밝힌 벤치마크의 치명적 한계

“Don’t Trust AI Scores”: OpenAI Reveals the Fatal Limitations of Benchmarks

TL;DR AI

핵심 요약

1분
  1. 오픈AI는 기존 질의응답형 벤치마크만으로는 최신 AI의 성능과 안전성을 충분히 측정하기 어렵다고 밝혔다.

  2. 평가 시 모델뿐 아니라 하네스, 토큰 예산, 재시도 횟수 등 실행 조건까지 함께 살펴봐야 한다는 공동 플레이북도 공개했다.

  3. 예산과 환경에 따라 성능이 크게 달라지고, 보상 해킹이나 데이터 오염이 결과를 왜곡할 수 있다고 설명했다.

  4. 이번 지침은 제3자 비교와 규제 판단이 프런티어·에이전트형 AI를 더 정확하게 평가하도록 돕기 위한 것이다.

원문 보기