AI 벤치마크는 인간의 이견을 무시한다, 구글 연구 결과
AI benchmarks systematically ignore how humans disagree, Google study finds

TL;DR AI
1분핵심 요약
구글·RIT 연구는 3~5명 평가 방식이 이견을 지운다고 밝혔다.
연구진은 5개 데이터로 보정한 시뮬레이터로 수천 가지 예산 분할을 시험했다.
항목당 10명 미만 평가자는 재현성 있는 비교에 부족한 경우가 많았다.
측정 지표에 따라 배분 전략이 달라지며 정확도와 분포 지표는 상반된 최적 배분을 요구한다.



