명령 계층 구조: LLM이 우선 지시를 우선시하도록 훈련하기
The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions

TL;DR AI
1분핵심 요약
OpenAI는 GPT-3.5가 지시 우선순위 체계를 따르도록 학습시켜, 우선권이 있는 명령과 신뢰할 수 없는 프롬프트를 구분하게 했다고 밝혔다.
이 방식은 악성 프롬프트 주입과 탈옥(jailbreak) 시도를 무시하도록 돕기 위한 것이다.
생성된 학습 데이터를 활용해, 이미 본 공격과 새로운 적대적 프롬프트 모두에 대한 강인성을 높였다고 설명했다.
또한 정상적인 성능을 크게 떨어뜨리지 않으면서 보안성을 강화했다고 말했다.



