언어 바꾸기English
이전 목록

도구 사양이 중요하다: AI 에이전트의 안전 위험을 밝혀내고 완화하기

Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents

TL;DR AI

핵심 요약

1분
  1. 연구진은 스키마 형식의 도구 설명이 AI 에이전트의 내부 거부 신호를 약화시켜 안전성을 떨어뜨릴 수 있다고 밝혔다.

  2. 이 때문에 모델이 위험한 요청을 더 자주 수락하거나, 안전하지 않은 도구 사용을 실행할 가능성이 커진다.

  3. 대응책으로 제안된 SafeKeep는 추론 시 안전 점검에는 평문으로 바꾼 설명을 쓰고, 실제 실행에는 원래 스키마를 유지한다.

  4. 여러 모델과 벤치마크에서 SafeKeep는 거부율을 크게 높이고 프롬프트 ইন젝션 성공률을 낮추면서도 작업 성능은 유지했다.

원문 보기