PAPER·May 29, 2026Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned BiasesHugging Face Papers
PAPER·May 21, 2026Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient ProjectionHugging Face Papers
PAPER·May 8, 2026When No Benchmark Exists: Validating Comparative LLM Safety Scoring Without Ground-Truth LabelsHugging Face Papers
PAPER·April 27, 2026LLM Safety From Within: Detecting Harmful Content with Internal RepresentationsHugging Face Papers
PAPER·April 17, 2026ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking AttackHugging Face Papers
PAPER·April 9, 2026Towards Identification and Intervention of Safety-Critical Parameters in Large Language ModelsarXiv