언어 전환 트리거는 언어 모델을 통해 잠복된 우회 경로를 거친다
Language-Switching Triggers Take a Latent Detour Through Language Models
TL;DR AI
1분핵심 요약
연구진은 8B 규모의 자기회귀 언어모델에서 라틴어 트리거가 영어 응답을 프랑스어로 바꾸는 현상을 추적했다.
논문은 3단계 회로를 확인했다: 초기 어텐션 헤드가 트리거를 조립하고, 잠재 하위공간이 이를 전달하며, 최종층 MLP가 프랑스어 출력으로 변환한다.
이 사례는 숨겨진 백도어가 표면적 입력 검사를 우회하고 일반적인 방어를 피할 수 있음을 보여준다.
이번 결과는 내부 표현을 악용하는 언어 전환 공격과 모델 보안의 새로운 위험을 시사한다.
