PAPER·May 27, 2026Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language ModelsHugging Face Papers
PAPER·May 21, 2026SpecBench: Measuring Reward Hacking in Long-Horizon Coding AgentsHugging Face Papers
PAPER·April 23, 2026Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, ChallengesHugging Face Papers