리뷰 아케이드: LLM 리뷰의 인간 정렬성과 게임 가능성에 대한 검토
Review Arcade: On the Human Alignment and Gameability of LLM Reviews
TL;DR AI
1분핵심 요약
ACL 2025 제출 논문 1,000편을 분석한 결과, LLM 생성 리뷰는 인간 평가와의 일치도가 낮았습니다.
프롬프트와 반복 실행에 따라 점수가 크게 흔들려 안정성도 떨어졌습니다.
연구진은 실질적 내용 수정 없이도 반복적으로 점수를 높일 수 있음을 보였습니다.
이는 컨퍼런스 심사에서 LLM을 신뢰할 수 있는 리뷰어로 쓰는 데 우려를 키웁니다.
