모델은 언제 생각을 바꿔야 하는가? 대규모 언어 모델의 맥락적 신념 관리
When Should Models Change Their Minds? Contextual Belief Management in Large Language Models

TL;DR AI
1분핵심 요약
연구진은 다중 턴 작업에서 언어 모델의 ‘맥락적 신념 관리’를 측정하는 벤치마크 BeliefTrack를 제안했다.
이 벤치마크는 Rule Discovery와 Circuit Diagnosis를 포함하며, 모델이 시간에 따라 신념을 올바르게 저장·갱신·무시하는지 정밀 평가한다.
기본 대형 언어 모델들은 긴 상호작용 동안 정확한 내부 신념 상태를 유지하는 데 자주 실패했다.
신념 상태 보상으로 학습하면 이런 실패가 크게 줄었고, 표현 수준의 steering도 성능 향상에 도움이 됐다.
