PAPER·4 days agoUltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language ModelsHugging Face Papers
PAPER·4 days agoClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical UnderstandingHugging Face Papers
PAPER·May 29, 2026EarlyTom: Early Token Compression Completes Fast Video UnderstandingHugging Face Papers
PAPER·May 19, 2026LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMsHugging Face Papers
PAPER·May 13, 2026Beyond the Last Layer: Multi-Layer Representation Fusion for Visual TokenizationHugging Face Papers
PAPER·April 28, 2026Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and GenerationHugging Face Papers