PAPER·July 31, 2026SpatialCLI: Learning to Reason With Spatial Tools, Then Without ThemHugging Face Papers
PAPER·July 31, 2026OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward ModelsarXiv
PAPER·July 30, 2026FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image VerificationarXiv
PAPER·July 30, 2026ReToken: One Token to Improve Vision-Language Models for Visual RetrievalHugging Face Papers
PAPER·July 29, 2026UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language ModelsHugging Face Papers
PAPER·July 27, 2026GOTS: Greedy Orthogonal Token Selection for High-Resolution Vision-Language ModelsarXiv
PAPER·July 24, 2026Visual Saliency Steering Distillation for Multimodal Chain-of-Thought ReasoningarXiv