구글 DeepMind 연구, 야생 환경에서 자율 AI 에이전트를 쉽게 탈취할 수 있는 여섯 가지 "함정" 폭로
Google DeepMind study exposes six "traps" that can easily hijack autonomous AI agents in the wild

TL;DR AI
2분핵심 요약
Google DeepMind 연구진이 'AI agent traps'라는 용어를 도입하고 자율 에이전트를 겨냥한 여섯 가지 함정 범주를 제시했다.
이 여섯 범주는 에이전트의 작동 주기 구성요소인 지각, 추론, 기억, 행동, 다중 에이전트 동학, 인간 감독을 각각 겨냥한다.
내용 삽입 함정은 HTML 주석·숨겨진 CSS·이미지 메타데이터·접근성 태그 등에 악성 지시를 숨기는 방식이고, 의미 조작 함정은 감정적이거나 권위적으로 들리는 콘텐츠와 프레이밍·앵커링 편향으로 추론을 오도한다.
장기 기억을 오염시켜 지식베이스 문서를 조작하면 특정 질의 출력이 왜곡될 수 있고, 행동 제어 함정은 에이전트의 실제 동작을 장악한다; 함정은 연쇄·다층·분산 형태로 결합되어 공격 표면이 조합적으로 증가한다.
논문은 조작된 환경으로부터 에이전트를 보호하는 것이 중요하다고 강조하며(자율주행차의 조작된 교통 표지와 유사한 비유), 공동저자 Franklin에 따르면 모든 함정 유형에 대해 개념증명 공격이 문서화되어 있다.



