PAPER·6 days agoLEAD: Breaking the No-Recovery Bottleneck in Long-Horizon ReasoningApple Machine Learning Research
PAPER·May 29, 2026When Should Models Change Their Minds? Contextual Belief Management in Large Language ModelsHugging Face Papers
PAPER·May 28, 2026VibeSearchBench: Benchmarking Long-horizon Proactive Search in the WildHugging Face Papers
PAPER·May 26, 2026Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to User's Digital WorldHugging Face Papers
PAPER·May 15, 2026MAP: A Map-then-Act Paradigm for Long-Horizon Interactive Agent ReasoningHugging Face Papers
PAPER·May 14, 2026RealICU: Do LLM Agents Understand Long-Context ICU Data? A Benchmark Beyond Behavior ImitationHugging Face Papers
PAPER·May 8, 2026Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is KeyHugging Face Papers
PAPER·May 6, 2026Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without VerifiersarXiv
PAPER·May 4, 2026Web2BigTable: A Bi-Level Multi-Agent LLM System for Internet-Scale Information Search and ExtractionHugging Face Papers