PAPER·May 29, 2026When Should Models Change Their Minds? Contextual Belief Management in Large Language ModelsHugging Face Papers
PAPER·May 29, 2026Loong: A Human-Like Long Document Translation Agent with Observe-and-Act Adaptive Context SelectionarXiv
PAPER·May 29, 2026When Should Models Change Their Minds? Contextual Belief Management in Large Language ModelsarXiv
PAPER·May 28, 2026Guiding LLM Post-training Data Engineering with Model Internals from Sparse AutoencodersHugging Face Papers
PAPER·May 28, 2026DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy PrefixesHugging Face Papers
PAPER·May 28, 2026Long Live The Balance: Information Bottleneck Driven Tree-based Policy OptimizationHugging Face Papers
PAPER·May 28, 2026OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured RecalibrationHugging Face Papers
PAPER·May 28, 2026Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient CalibrationHugging Face Papers
PAPER·May 28, 2026The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World IntelligenceHugging Face Papers
PAPER·May 27, 2026Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language ModelsHugging Face Papers