RankJudge: 다중 턴 LLM-as-a-Judge 합성 벤치마크 생성기
RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator
TL;DR AI
1분핵심 요약
연구진은 다중 턴, 참고문서 기반 대화를 평가하기 위한 합성 벤치마크 생성기 RankJudge를 제안했다.
이 생성기는 한쪽에만 단일 오류를 주입한 대화 쌍을 만들어, 어느 응답이 더 나은지 더 명확하게 판별할 수 있게 한다.
이 벤치마크는 머신러닝, 바이오메디슨, 금융 분야에 적용됐고, 21개의 최첨단 LLM judge를 평가하는 데 사용됐다.
평가 결과는 Bradley-Terry 모델로 순위화됐으며, 여러 대안 설정에서도 순위가 안정적으로 유지됐다.
이번 연구는 현실적인 judge 평가의 공백을 메우고, 난이도 인지 샘플링으로 더 깨끗한 벤치마킹을 가능하게 한다.
