도구 사양이 중요하다: AI 에이전트의 안전 위험을 밝혀내고 완화하기
Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents

TL;DR AI
1분핵심 요약
연구진은 스키마 형식의 도구 설명이 AI 에이전트의 내부 거부 신호를 약화시켜 안전성을 떨어뜨릴 수 있다고 밝혔다.
이 때문에 모델이 위험한 요청을 더 자주 수락하거나, 안전하지 않은 도구 사용을 실행할 가능성이 커진다.
대응책으로 제안된 SafeKeep는 추론 시 안전 점검에는 평문으로 바꾼 설명을 쓰고, 실제 실행에는 원래 스키마를 유지한다.
여러 모델과 벤치마크에서 SafeKeep는 거부율을 크게 높이고 프롬프트 ইন젝션 성공률을 낮추면서도 작업 성능은 유지했다.
