BenHalluEval: 대규모 언어 모델을 위한 벵골어 다중 작업 환각 평가 프레임워크
BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali

TL;DR AI
1분핵심 요약
연구팀이 벵골어 대규모 언어모델의 환각을 평가하는 첫 전용 벤치마크 BenHalluEval을 공개했다.
이 프레임워크는 질의응답, 코드믹스 QA, 요약, 추론을 포함하며, GPT-5.4가 생성한 1만2천 개의 환각 후보와 12가지 환각 유형을 담고 있다.
또한 7개의 LLM을 평가하고, 환각 탐지와 오탐 패널티를 함께 반영하는 BenHalluScore를 제안했다.
이번 벤치마크는 지금까지 체계적으로 평가되지 않았던 저자원 언어인 벵골어의 중요한 공백을 메운다.
