PAPER·17 hours agoSee2Think: Do Multimodal Models Really Use Intermediate Visual States?Hugging Face Papers
PAPER·5 days agoDICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language ModelsarXiv
PAPER·5 days agoPerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language ModelsHugging Face Papers