PAPER·9 hours agoFrom RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-ImprovementHugging Face Papers
TECH·yesterdayNVIDIA AI Releases Molt: A PyTorch-Native Agentic Reinforcement Learning FrameworkMarkTechPost
TECH·2 days agoSinking Machines unveils 'Inkling-Small'... Achieves class-leading performance at one-quarter the sizeAI타임스
PAPER·3 days agoβ-OPSD: Deriving with Policy Optimization, Training with Self-DistillationHugging Face Papers
PAPER·3 days agoEchoverse: Deep, Evolving Environments for Training Computer-Use Agents at ScaleHugging Face Papers
PAPER·3 days agoFrontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning EngineeringHugging Face Papers
PAPER·3 days agoEvaluation-Verification Reward for Consistent Multi-Reference Image EditingHugging Face Papers
PAPER·4 days agoFrontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning EngineeringarXiv