INS-ActBench: 대규모 언어 모델의 전문 보험계리 역량을 평가하기 위한 종합 벤치마크
INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models

TL;DR AI
1분핵심 요약
연구진이 보험계리 전문 역량을 평가하는 벤치마크 INS-ActBench를 공개했다.
이 벤치마크는 16개 보험계리 협회의 공개 시험과 예시 문항을 바탕으로 12,050문항을 구성했다.
평가 결과, LLM은 표준 지식 문제는 잘 풀었지만 장문 사례 추론과 스프레드시트·R 기반 실무에서는 크게 약했다.
즉, 시험형 성능과 실제 보험계리 업무의 신뢰성 사이에 큰 격차가 있음을 보여준다.
