Your Embedding Model is SMARTer Than You Think
TL;DR AI
2 min readKey summary
SMART upgrades standard single-vector embedding models for multimodal retrieval by reusing frozen hidden states in a late-interaction setup.
The approach avoids full multi-vector retraining and can optionally use lightweight post-training to boost performance.
It delivers state-of-the-art multimodal retrieval results on benchmarks like MMEB-V2 and Visual Document retrieval.
The key benefit is better accuracy with lower computational cost, making advanced retrieval more practical.
