PAPER·4 days agoVeritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI DetectionarXiv
PAPER·July 27, 2026DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language ModelsarXiv
PAPER·July 27, 2026PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language ModelsHugging Face Papers
PAPER·July 24, 2026Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMsarXiv
PAPER·July 23, 2026MVEI & EmObserver: Empowering MLLM-Oriented Visual Emotional Intelligence via Emotion Statement JudgementarXiv
PAPER·July 20, 2026LVSum: A Benchmark for Timestamp-Aware Long Video SummarizationApple Machine Learning Research
PAPER·May 29, 2026ERGeoBench: A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language ModelsarXiv
PAPER·May 29, 2026GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar ReselectionHugging Face Papers
PAPER·May 28, 2026Mobile-Aptus: Confidence-Driven Proactive and Robust Interaction in MLLM-based Mobile-Using AgentsarXiv
PAPER·May 27, 2026GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar ReselectionarXiv
PAPER·May 27, 2026Squeezing Capacity from Multimodal Large Language Models for Subject-driven GenerationHugging Face Papers