언어 모델 내부 해석의 신뢰성을 위한 활성화 오라클의 신뢰도와 보정
Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals
TL;DR AI
1분핵심 요약
연구진은 Qwen 계열 두 모델에서 activation oracle용 신뢰도 추정법 6가지를 비교 평가했다.
bootstrap mode frequency가 가장 잘 보정된 방법으로 나타났고, answer-word log-probability보다 기대 보정 오차가 더 낮았다.
이번 결과는 화이트박스 해석과 activation 기반 분석에서 더 믿을 수 있는 confidence score를 제공한다.
연구팀은 Qwen3.6-27B용 새 oracle·target 모델과 코드도 공개했으며, log-probability는 빠른 선별용으로는 여전히 유용하다.
