언어 바꾸기English
이전 목록

명령 계층 구조: LLM이 우선 지시를 우선시하도록 훈련하기

The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions

TL;DR AI

핵심 요약

1분
  1. OpenAI는 GPT-3.5가 지시 우선순위 체계를 따르도록 학습시켜, 우선권이 있는 명령과 신뢰할 수 없는 프롬프트를 구분하게 했다고 밝혔다.

  2. 이 방식은 악성 프롬프트 주입과 탈옥(jailbreak) 시도를 무시하도록 돕기 위한 것이다.

  3. 생성된 학습 데이터를 활용해, 이미 본 공격과 새로운 적대적 프롬프트 모두에 대한 강인성을 높였다고 설명했다.

  4. 또한 정상적인 성능을 크게 떨어뜨리지 않으면서 보안성을 강화했다고 말했다.

원문 보기