복제 가능한 컨텍스트에 기반한 안전장치는 LLM에 신뢰할 수 있는 안전을 제공할 수 없다
Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs
TL;DR AI
1분핵심 요약
복제 가능한 사용자 문맥에 의존하는 LLM 안전장치는 공격자가 합법 사용자처럼 위장해 우회할 수 있다는 점을 논문이 분석했다.
연구는 이런 조건에서 안전하게 제공할 수 있는 도움의 한계치를 정식화하고, 유용한 성능·신뢰할 수 있는 안전·개방적 접근은 동시에 달성하기 어렵다고 주장한다.
핵심 취약점은 듀얼유스 작업에서 현재의 접근통제와 모더레이션이 실제 다운스트림 사용을 정확히 구분하지 못한다는 데 있다.
대안으로 저자들은 신뢰된 자격증명과 조작하기 더 어려운 증거를 사용해 실제 사용자를 더 잘 식별하는 방식을 제안한다.
