PAPER·yesterdayCLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge AcquisitionHugging Face Papers
PAPER·2 days agoMage-VL: An Efficient Codec-Native Streaming Multimodal Foundation ModelHugging Face Papers
PAPER·July 23, 2026MVEI & EmObserver: Empowering MLLM-Oriented Visual Emotional Intelligence via Emotion Statement JudgementarXiv