PAPER·May 29, 2026Before the Shutter: Aesthetic and Actionable Portrait Photography Planning in 3D ScenesarXiv
CODING·May 25, 2026Stop Flying Blind: We Built an LLM Evaluation Framework That Works Across 17+ Agent FrameworksDev.to
PAPER·May 20, 2026PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language ModelsHugging Face Papers
PAPER·May 19, 2026FINESSE-Bench: A Hierarchical Benchmark Suite for Financial Domain Knowledge and Technical Analysis in Large Language ModelsHugging Face Papers
PAPER·May 19, 2026SCICONVBENCH: Benchmarking LLMs on Multi-Turn Clarification for Task Formulation in Computational SciencearXiv
PAPER·May 8, 2026CreativityBench: Evaluating Agent Creative Reasoning via Affordance-Based Tool RepurposingHugging Face Papers
PAPER·May 7, 2026The First Token Knows: Single-Decode Confidence for Hallucination DetectionHugging Face Papers
PAPER·April 29, 2026AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature DiscoveryHugging Face Papers