언어 바꾸기English
이전 목록

확산 기반 멀티모달 대규모 언어 모델을 위한 시각적 중복 제어 병렬 디코딩

Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models

TL;DR AI

핵심 요약

1분
  1. 연구진은 확산 기반 멀티모달 LLM의 병렬 토큰 선택에서 중복된 시각적 근거를 줄이는 학습 없는 디코딩 방법을 제안했다.

  2. 논문은 신뢰도 기반 병렬 디코딩이 같은 시각 단서를 반복적으로 활용할 수 있음을 보이고, 이를 측정하는 Visual Redundancy Index를 도입했다.

  3. Visual-Redundancy-Controlled Decoding(VRCD)은 추론 시 상호 보완적인 토큰 위치를 우선해 이미지 정보를 더 고르게 활용하도록 한다.

  4. 이 방식은 M3CoT와 MMBench 같은 벤치마크에서 정확도를 높이면서도 런타임 증가를 비교적 작게 유지했다.

원문 보기