프롬프트 인젝션에서 지속적 제어까지: Trojan 백도어로부터 Agentic Harness 방어하기
From Prompt Injection to Persistent Control: Defending Agentic Harness Against Trojan Backdoors
TL;DR AI
1분핵심 요약
연구진은 로컬 LLM 에이전트가 작업공간 파일과 세션을 넘나드는 다단계 프롬프트 주입으로 백도어될 수 있음을 발견했다.
ClawTrojan 벤치마크에서 개별 단계는 무해해 보여도 GPT-5.4에 대한 공격 성공률이 높게 나타났다.
기존 방어책은 보통 각 행동을 따로 검사해, 여러 단계에 걸쳐 분산된 지시문을 놓칠 수 있다.
DASGuard는 신뢰할 수 없는 출처의 제어성 텍스트를 추적·정화하는 런타임 방어로 제안됐다.
