친절하게 다시 쓰기: 재작성 기반의 무해한 투영으로 LLM 데이터 포이즈닝 공격 방어
Be Kind, Rewrite: Benign Projections via Rewriting Defend Against LLM Data Poisoning Attacks
TL;DR AI
1분핵심 요약
연구진은 LLM 데이터 오염 공격을 막기 위한 저비용 방어 기법인 ‘오픈북 양성 리라이팅’을 제안했다.
이 방법은 정상 참조 샘플을 활용해 학습 데이터를 더 안전한 프롬프트 공간으로 다시 써서 백도어 위험을 줄인다.
여러 공격 방식과 모델에서 기존 방어보다 더 강한 방어 성능과 더 나은 효율을 보였고, 과제 성능도 유지했다.
트리거가 없는 오염까지 대응해 실제 LLM 보안을 강화하는 더 실용적인 방어책으로 평가된다.
