XPENG releases TuringViT for smart driving and humanoid robots

TL;DR AI
2 min readKey summary
XPENG released TuringViT, a vision encoder for vision-language and vision-language-action systems.
It introduced two versions, TuringViT-18L and TuringViT-24L, aimed at smart driving, cabin AI, and humanoid robots.
XPENG says the smaller model outperformed comparable baselines on throughput at 1536×1536 resolution.
The model was trained on 850 million image-text pairs and reached 83.6% on six zero-shot benchmarks.



