LLM은 허위라는 명시적 경고를 받고도 거짓 주장을 사실로 믿는다
LLMs believe false statements even after explicit warnings that they're false

TL;DR AI
1분핵심 요약
연구진은 허위 주장과 그에 대한 명시적 부정·정정이 포함된 문서로 LLM을 미세조정했다.
훈련 데이터가 해당 주장이 거짓이라고 분명히 알려줘도, 모델은 대체로 여전히 그것을 사실처럼 받아들였다.
이 같은 현상은 유해하거나 기만적인 행동을 줄이려는 훈련에서도 나타났다.
단순한 사실 확인이나 경고 문구만으로는 모델의 믿음을 안정적으로 바꾸기 어렵다는 우려가 나온다.
