PAPER·yesterdayQwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI AgentsHugging Face Papers
PAPER·2 days agoX-NavDP: Generalizing Navigation Diffusion Policy to Novel Behavior and Embodiments with Group Q-score Reweighted MatchingarXiv
PAPER·3 days agoCollaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement LearningarXiv
TECH·4 days agoA $500 RL fine-tune of a 9B open model beat frontier models on catalog review | Hacker NewsHacker News
TECH·4 days agoKimi AI and kvcache-ai Open Source 'AgentENV': A Distributed System that Powers Agentic Reinforcement Learning (RL) Training for Kimi K3MarkTechPost
PAPER·5 days agoSkill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving SkillsHugging Face Papers
PAPER·5 days agoMolt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement LearningHugging Face Papers
PAPER·July 25, 2026Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving SkillsarXiv