PAPER·3 days agoUltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language ModelsHugging Face Papers
PAPER·4 days agoClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical UnderstandingHugging Face Papers
PAPER·May 29, 2026EarlyTom: Early Token Compression Completes Fast Video UnderstandingHugging Face Papers
PAPER·May 19, 2026LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMsHugging Face Papers
PAPER·May 13, 2026Beyond the Last Layer: Multi-Layer Representation Fusion for Visual TokenizationHugging Face Papers
PAPER·April 28, 2026Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and GenerationHugging Face Papers
TECH·April 8, 2026Tesla rolls out FSD v14.3 update with quicker reaction time and other improvementsDigital Trends
TECH·April 7, 2026Meta AI Releases EUPE: A Compact Vision Encoder Family Under 100M Parameters That Rivals Specialist Models Across Image Understanding, Dense Prediction, and VLM TasksMarkTechPost
TECH·April 3, 2026Zhipu AI's GLM-5V-Turbo turns design mockups directly into executable front-end codeTHE DECODER