효율적인 옴니모달 LLM을 위한 단계 적응형 토큰 선택
Stage-adaptive Token Selection for Efficient Omni-modal LLMs
TL;DR AI
1분핵심 요약
연구진은 omni-modal LLM의 추론 효율을 높이는 학습 없는 방법 SEATS를 제안했다.
SEATS는 모델 입력 전에 불필요한 시각·음성 토큰을 먼저 줄이고, 이후 LLM 내부에서 층별 중요도 패턴에 따라 추가 토큰을 제거한다.
Qwen2.5-Omni와 Qwen3-Omni에서 FLOPs를 9.3배 줄이고 prefill 속도를 4.8배 높이면서도 기준 성능의 96.3%를 유지했다.
이 연구는 재학습 없이도 단계별 토큰 선택을 조정해 멀티모달 추론 비용을 크게 낮출 수 있음을 보여준다.
