언어 바꾸기English
이전 목록

ReMoE: 메모리 제약 MoE LLM 추론에서 라우터 미세조정을 통한 전문가 재사용 향상

ReMoE: Boosting Expert Reuse through Router Fine-Tuning in Memory-Constrained MoE LLM Inference

TL;DR AI

핵심 요약

1분
  1. 연구진은 MoE LLM 추론을 위한 라우터 미세조정 기법 ReMoE를 제안해 토큰 라우팅을 더 안정적으로 만들었다.

  2. ReMoE는 최근 사용한 전문가(expert)를 더 우선하도록 유도해 expert 재사용률을 26% 높이고 캐시 지역성도 개선한다.

  3. 그 결과 느린 저장장치에서 불러오는 expert 횟수가 줄어 처리량은 높아지고, 토큰당 생성 시간은 더 짧아진다.

  4. 이 방법은 추가 런타임 연산 없이 DeepSeek, Qwen, vLLM, Jetson Orin NX 등에서 실제 성능 향상을 보였다.

원문 보기