Paper·July 31, 2026SpatialCLI: Learning to Reason With Spatial Tools, Then Without ThemHugging Face Papers
Paper·July 30, 2026ReToken: One Token to Improve Vision-Language Models for Visual RetrievalHugging Face Papers
Paper·July 29, 2026UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language ModelsHugging Face Papers
Paper·July 27, 2026GOTS: Greedy Orthogonal Token Selection for High-Resolution Vision-Language ModelsarXiv
Paper·July 24, 2026Visual Saliency Steering Distillation for Multimodal Chain-of-Thought ReasoningarXiv
Paper·July 17, 2026Show Me Examples: Inferring Visual Concepts from Image SetsApple Machine Learning Research
Paper·June 2, 2026SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation ModelsHugging Face Papers
Paper·June 2, 2026PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language UnderstandingHugging Face Papers
Paper·June 2, 20263DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via CodeHugging Face Papers