OpenAI, API 설정 두 가지로 GPT-5.6 Sol의 ARC-AGI-3 점수가 3배로 뛰었다고 밝혀
OpenAI Says Two API Settings Tripled GPT-5.6 Sol's ARC-AGI-3 Score

TL;DR AI
1분핵심 요약
OpenAI는 Responses API의 retained reasoning과 compaction 설정을 켜자 GPT-5.6 Sol의 ARC-AGI-3 공개 세트 점수가 13.3%에서 38.3%로 올랐다고 밝혔다.
또한 출력 토큰 사용량은 약 6배 줄었다고 설명했다.
OpenAI는 기존 평가 하니스가 상호작용형 퍼즐 과제에서 유용한 추론을 이어가도록 모델을 돕지 못했다고 지적했다.
이번 결과는 에이전트 벤치마크 성능이 모델 가중치뿐 아니라 API 설정과 하니스 설계에도 크게 좌우됨을 보여준다.
