PAPER·June 2, 2026HakushoBench: A Japanese Chart and Table VQA Benchmark from Governmental White PapersHugging Face Papers
PAPER·June 2, 2026VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time OptimizationarXiv
PAPER·June 2, 2026Active Exploring like a Pigeon: Reinforcing Spatial Reasoning via Agentic Vision-Language ModelsarXiv
PAPER·June 1, 2026Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture AssemblyHugging Face Papers
PAPER·June 1, 2026Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?Hugging Face Papers
PAPER·May 30, 2026Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric ReasoningHugging Face Papers
PAPER·May 30, 2026Why Far Looks Up: Probing Spatial Representation in Vision-Language ModelsHugging Face Papers
PAPER·May 29, 2026Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive OptimizationarXiv
PAPER·May 29, 2026LoMo: Local Modality Substitution for Deeper Vision-Language FusionHugging Face Papers
PAPER·May 29, 2026How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial ReasoningHugging Face Papers