PAPER·May 28, 2026TRACER: Turn-level Regret Matching with Inner Reinforcement Credit for Cooperative Multi-LLM ReasoningarXiv
PAPER·May 22, 2026From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM ReasoningHugging Face Papers
PAPER·May 19, 2026Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM ReasoningarXiv
PAPER·May 14, 2026Adaptive Teacher Exposure for Self-Distillation in LLM ReasoningHugging Face Papers
PAPER·May 11, 2026Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability LearningHugging Face Papers
PAPER·May 7, 2026When to Think, When to Speak: Learning Disclosure Policies for LLM ReasoningHugging Face Papers
PAPER·May 5, 2026ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement LearningHugging Face Papers
PAPER·May 1, 2026ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement LearningarXiv
TECH·April 30, 2026Catching both math and coding... Apple unveils new technology to improve LLM reasoning accuracy디지털투데이