PAPER·May 28, 2026OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured RecalibrationHugging Face Papers
PAPER·May 28, 2026From Pixels to Words -- Towards Native One-Vision Models at ScaleHugging Face Papers
PAPER·May 27, 2026Gemini Embedding 2: A Native Multimodal Embedding Model from GeminiHugging Face Papers
PAPER·May 27, 2026LLaVA-OneVision-2: Towards Next-Generation Perceptual IntelligenceHugging Face Papers
TECH·May 24, 2026ByteDance study finds that asking LMMs questions beats making it transcribe text for long document trainingTHE DECODER
PAPER·May 23, 2026VGenST-Bench: A Benchmark for Spatio-Temporal Reasoning via Active Video SynthesisHugging Face Papers