UltraViT: 대규모 비전-언어 모델을 위한 지연시간 최적화 온디바이스 비전 인코더
UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models
TL;DR AI
1분핵심 요약
연구진은 대형 비전-언어 모델의 온디바이스 지연 시간을 줄이도록 설계한 비전 인코더 UltraViT를 공개했다.
UltraViT는 이종 spatial mixer를 적용한 피라미드 구조와 2단계 생성형 사전학습을 사용한다.
사전학습은 dense distillation과 고정된 LLM 감독을 결합해 멀티모달 정렬과 효율을 높였다.
실험에서 UltraViT는 인코더 중심 기준선보다 더 좋은 성능을 내면서도 기기에서 약 1.7배 더 빠르게 동작했다.
