GPT-5.5, 벤치마크 최고 성적에도 여전히 자주 환각… API 비용은 20% 더 높아
GPT-5.5 tops benchmarks but still hallucinates frequently at a 20 percent higher API cost

TL;DR AI
1분핵심 요약
OpenAI의 GPT-5.5가 Artificial Analysis의 지능 지수에서 1위를 차지하며 Claude Opus 4.7과 Gemini 3.1 Pro Preview를 앞섰다.
GPT-5.4보다 토큰을 덜 사용했지만, 실제 API 비용은 약 20% 상승했다.
벤치마크 성능이 좋아졌음에도 별도 테스트에서는 환각이 여전히 잦고, BullshitBench에서도 낮은 성적을 보였다.
즉, 점수와 토큰 효율이 높아져도 실제 신뢰성이 함께 좋아진다고 보기는 어렵다.



