언어 바꾸기English
이전 목록

LLMEval-Logic: LLM의 논리적 추론을 위한, 적대적 강화가 적용된 솔버 검증 중국어 벤치마크

LLMEval-Logic: A Solver-Verified Chinese Benchmark for Logical Reasoning of LLMs with Adversarial Hardening

TL;DR AI

핵심 요약

1분
  1. 연구진이 LLM의 논리적 추론 능력을 평가하는 새로운 중국어 벤치마크 LLMEval-Logic을 공개했다.

  2. 이 벤치마크는 전문가가 검수한 자연어 문제, Z3로 검증한 형식 주석, 루브릭 기반 채점을 결합했다.

  3. 또한 적대적 워크플로로 만든 고난도 하위 집합을 통해 시험 난도를 크게 높였다.

  4. 14개 최첨단 모델을 평가한 결과 가장 어려운 과제에서 성능이 제한적이었고, 추론 격차가 드러났다.

원문 보기