GPT-Red: 자기 대결을 통한 대규모 자동 레드팀링
GPT-Red: Automated Red Teaming via Self-Play at Scale
TL;DR AI
1분핵심 요약
OpenAI는 대규모로 프롬프트 인젝션 공격을 찾아내는 자동화 레드팀 에이전트 GPT-Red를 공개했다.
GPT-Red는 여러 방어 모델과의 확장 가능한 self-play로 학습해, 프런티어 LLM 전반에서 새로운 공격 기법을 발견했다.
이 에이전트는 GPT-5.5까지의 이전 GPT 모델들을 무너뜨렸고, 인간 레드팀보다 더 많은 공격을 찾아냈으며, 미지의 환경에서도 일반화됐다.
이 시스템은 GPT-5.6을 프롬프트 인젝션과 유사한 탈옥형 취약점에 더 강하게 만드는 데 활용됐다.
