해커들이 챗봇의 ‘성격’을 악용하는 방법을 익히고 있다
Hackers are learning to exploit chatbot ‘personalities’

TL;DR AI
1분핵심 요약
해커들이 사회공학식 프롬프트와 챗봇 페르소나를 이용해 AI 안전장치를 우회하고 있다.
초기에는 단순한 탈옥이 많았지만, 이제는 더 대화형이고 탐지하기 어려운 공격으로 진화했다.
연구자들은 챗봇이 사회적 신호를 따르고 역할놀이를 하는 성향이 악용돼 유해한 답변이 유도될 수 있다고 지적한다.
ChatGPT와 Claude처럼 더 자연스러워질수록, 언어 기반 조작에 대한 방어는 더 어려워지고 있다.


