언어 바꾸기English
이전 목록

UltraViT: 대규모 비전-언어 모델을 위한 지연시간 최적화 온디바이스 비전 인코더

UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

TL;DR AI

핵심 요약

1분
  1. 연구진은 대형 비전-언어 모델의 온디바이스 지연 시간을 줄이도록 설계한 비전 인코더 UltraViT를 공개했다.

  2. UltraViT는 이종 spatial mixer를 적용한 피라미드 구조와 2단계 생성형 사전학습을 사용한다.

  3. 사전학습은 dense distillation과 고정된 LLM 감독을 결합해 멀티모달 정렬과 효율을 높였다.

  4. 실험에서 UltraViT는 인코더 중심 기준선보다 더 좋은 성능을 내면서도 기기에서 약 1.7배 더 빠르게 동작했다.

원문 보기