OmniScope: 옴니모달 대규모 언어 모델을 위한 모달리티 분리형 토큰 압축
OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models
TL;DR AI
1분핵심 요약
OmniScope는 오디오·비디오를 각각 따로 압축하는 학습 없는 토큰 압축 기법이다.
질문을 공통 기준으로 삼아 모달리티별 중요도를 계산하고, 비디오 토큰은 앵커-델타 방식으로 줄이며 오디오 토큰은 초 단위로 병합한다.
4개 벤치마크와 2개 Qwen2.5-Omni 규모에서 기존 방법보다 성능이 좋았고, 토큰 25%만 남겨도 최대 3.53배 빠른 prefill과 15% 이상 낮은 GPU 메모리를 보였다.
이 접근은 기존 압축법의 약점인 교차 모달 중요도 불일치를 완화해, 정확도를 크게 잃지 않으면서 멀티모달 LLM의 추론 비용을 줄이는 데 의미가 있다.
