PAPER·6 days agoLEAD: Breaking the No-Recovery Bottleneck in Long-Horizon ReasoningApple Machine Learning Research
PAPER·May 28, 2026TRACER: Turn-level Regret Matching with Inner Reinforcement Credit for Cooperative Multi-LLM ReasoningarXiv
PAPER·May 22, 2026From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM ReasoningHugging Face Papers
PAPER·May 21, 2026You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 TrajectoriesarXiv
PAPER·May 20, 2026CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic ReasoningarXiv
PAPER·May 19, 2026Stress-Testing the Reasoning Competence of LLMs With Proofs Under Minimal FormalismHugging Face Papers
PAPER·May 13, 2026LoopUS: Recasting Pretrained LLMs into Looped Latent Refinement ModelsHugging Face Papers
PAPER·May 11, 2026Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability LearningHugging Face Papers
PAPER·April 28, 2026LaDiR: Latent Diffusion Enhances LLMs for Text ReasoningApple Machine Learning Research
PAPER·April 21, 2026OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement LearningarXiv