언어 바꾸기English
이전 목록

OpenAI, 최신 API와 두 가지 추가 설정으로 GPT-5.6 Sol이 ARC-AGI-3에서 Opus 5를 능가했다고 주장

OpenAI claims GPT-5.6 Sol beats Opus 5 on ARC-AGI-3 with its latest API and two additional settings

TL;DR AI

핵심 요약

2분
  1. OpenAI는 Responses API의 Retained Reasoning과 Compaction을 적용한 ARC-AGI-3 테스트에서 GPT-5.6 Sol이 38.3%를 기록해 Claude Opus 5의 30.2%를 앞섰다고 밝혔다.

  2. 하지만 공식 벤치마크 하네스에서는 7.8%로 크게 낮아져, 테스트 설정에 따라 결과가 크게 달라질 수 있음을 보여줬다.

  3. ARC Prize와 프랑수아 숄레는 제공사별 설정도 투명하게 공개된다면 허용될 수 있지만, 공정한 비교를 위해 표준화된 테스트가 중요하다고 강조했다.

  4. 이번 논쟁은 API 기능과 하네스 설계가 모델 간 성능 비교와 벤치마크 공정성에 큰 영향을 줄 수 있음을 드러낸다.

원문 보기