PAPER·2 days agoTowards Robust Reinforcement Learning for Small-Scale Language Model AgentsHugging Face Papers
PAPER·May 27, 2026Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language ModelsHugging Face Papers
PAPER·May 21, 2026SpecBench: Measuring Reward Hacking in Long-Horizon Coding AgentsHugging Face Papers
PAPER·May 12, 2026Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative CriteriaHugging Face Papers
PAPER·April 28, 2026Discovering Agentic Safety Specifications from 1-Bit Danger SignalsHugging Face Papers