충실도 지표는 충실도를 측정하지 않는다: 정답을 활용한 메타 평가
Faithfulness Metrics Don't Measure Faithfulness: A Meta-Evaluation with Ground Truth
TL;DR AI
1분핵심 요약
연구진은 13개 과제와 10개 모델에서 수집한 3,066개의 라벨된 chain-of-thought 예시로 벤치마크 BonaFide를 만들었다.
주요 faithfulness 지표들을 정답 라벨과 비교해 평가한 결과, 대부분이 거의 무작위 수준의 성능을 보였고 편향도 확인됐다.
특히 긴 추론 흔적에서는 성능이 더 떨어졌고, 다른 설정으로의 전이성도 낮았으며 계산 비용은 높았다.
이번 연구는 널리 쓰이는 faithfulness 점수가 LLM의 추론이 실제로 충실한지 믿을 만하게 측정하지 못할 수 있음을 보여준다.
