언어 바꾸기English
이전 목록

새 수학 벤치마크, AI 모델이 해답이 없는 문제도 자신 있게 푼다는 사실 드러내

New math benchmark reveals AI models confidently solve problems that have no solution

TL;DR AI

핵심 요약

1분
  1. SOOHAK은 대학원 수준 수학 문제와 일부러 잘못 만든 거절 과제를 함께 평가하는 439문항 벤치마크다.

  2. 최상위 AI 모델들도 가장 어려운 문제에서는 인간 전문가보다 한참 낮은 성능을 보여, 고난도 수학 추론의 한계를 드러냈다.

  3. 어떤 모델도 풀 수 없는 문제를 가려내는 정확도에서 50%를 넘지 못해, 잘못된 질문을 식별하는 능력도 취약했다.

  4. 이번 결과는 AI가 더 많은 수학 문제를 푸는 데는 강해져도, 정답이 없는 문제를 판단하는 능력은 아직 부족하다는 점을 보여준다.

원문 보기