Paper·July 29, 2026Towards Robust Reinforcement Learning for Small-Scale Language Model AgentsHugging Face Papers
Paper·May 27, 2026Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language ModelsHugging Face Papers
Paper·May 21, 2026SpecBench: Measuring Reward Hacking in Long-Horizon Coding AgentsHugging Face Papers
Paper·May 12, 2026Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative CriteriaHugging Face Papers