SoundnessBench: 당신의 AI 과학자는 정말 좋은 연구 아이디어와 나쁜 아이디어를 구분할 수 있을까?
SoundnessBench: Can Your AI Scientist Really Tell Good Research Ideas from Bad Ones?
TL;DR AI
1분핵심 요약
연구진은 ICLR 제출 논문에서 재구성한 1,099개의 머신러닝 제안서에 심사자의 soundness 라벨과 원문 감사(audit)를 붙인 벤치마크 SoundnessBench를 공개했다.
12개의 최첨단 LLM을 평가한 결과, 모델들은 강한 낙관 편향을 보여 기본 프롬프트에서는 약한 아이디어도 자주 타당하다고 판단했다.
더 엄격한 프롬프트는 전체 실패율보다 오류 유형을 바꾸는 데 더 가까웠고, 프롬프트 조정만으로는 문제를 해결하지 못했다.
저자들은 데이터 오염과 다른 혼란 요인도 점검했으며, 이 행동을 설명하는 단일한 단순 원인은 없다고 결론지었다.