‘금지 주제’가 AI 해커를 막는 비결일까?
Could 'banned topics' be the secret to stopping AI hackers?

TL;DR AI
1분핵심 요약
Tracebit은 가짜 자격 증명 안에 금지 주제 텍스트를 숨겨 AI 해킹 에이전트가 자체 안전 필터를 작동시키고 공격을 멈추게 하는 방어법을 시험했다.
주요 모델들에서 이 방식은 성공적인 침입, 관리자 권한 획득, 지속적 장악을 크게 줄였다.
동시에 카나리 디코이 경보는 유지돼, 방어팀이 빠르게 진행되는 자율 공격에 대응할 시간을 벌 수 있었다.
프롬프트 인젝션이나 모델 혼란을 완전히 해결하진 못하지만, AI 안전 제한을 방어 도구로 바꾼다는 점이 의미 있다.


