VisCo: 시각 토큰 압축을 위한 내재적 인코더로서 대규모 언어 모델 활용
VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression
TL;DR AI
1분핵심 요약
VisCo는 사전학습된 비전-언어 모델을 자체 압축기로 재활용하는 파라미터 공유 self-compression 프레임워크다.
이미지 정보를 소수의 메모리 토큰에 인코딩하고, 디코딩 과정에서 계층적 정보를 전달해 시각 토큰 수를 크게 줄인다.
기존 압축 기법보다 다양한 압축 비율에서 더 좋은 성능을 보였고, 극단적 압축에서도 안정적으로 작동했다.
원본 시각 토큰과 함께 쓰면 베이스 모델의 성능을 더 높일 수도 있어, 추론 효율과 정확도를 함께 개선한다.
