Be Kind, Rewrite: Benign Projections via Rewriting Defend Against LLM Data Poisoning Attacks
TL;DR AI
2 min readKey summary
Researchers introduced open-book benign rewriting, a low-cost defense for LLM data poisoning.
It uses benign reference samples to rewrite training data into safer prompt space, reducing backdoor risk.
Across multiple attacks and models, it outperformed prior defenses, improved efficiency, and preserved task quality.
The method also handles non-trigger poisoning, making it a stronger practical safeguard for LLM security.
