언어 바꾸기English
이전 목록

GPT-5.5, 벤치마크 최고 성적에도 여전히 자주 환각… API 비용은 20% 더 높아

GPT-5.5 tops benchmarks but still hallucinates frequently at a 20 percent higher API cost

TL;DR AI

핵심 요약

1분
  1. OpenAI의 GPT-5.5가 Artificial Analysis의 지능 지수에서 1위를 차지하며 Claude Opus 4.7과 Gemini 3.1 Pro Preview를 앞섰다.

  2. GPT-5.4보다 토큰을 덜 사용했지만, 실제 API 비용은 약 20% 상승했다.

  3. 벤치마크 성능이 좋아졌음에도 별도 테스트에서는 환각이 여전히 잦고, BullshitBench에서도 낮은 성적을 보였다.

  4. 즉, 점수와 토큰 효율이 높아져도 실제 신뢰성이 함께 좋아진다고 보기는 어렵다.

원문 보기