SpecMD: 추측적 전문가 프리패칭에 대한 종합 연구
SpecMD: A Comprehensive Study on Speculative Expert Prefetching

TL;DR AI
1분핵심 요약
SpecMD는 다양한 하드웨어 환경에서 MoE 전문가 캐시 정책을 평가하는 표준 벤치마크를 제시했다.
연구는 LRU, LFU 같은 일반적인 시간 지역성 기반 휴리스틱이 MoE의 실제 접근 패턴과 잘 맞지 않음을 보여준다.
새로운 축출 정책인 Least-Stale는 충돌 미스를 줄이고 적중률을 높이며 첫 토큰 지연시간을 낮춘다.
효율적인 전문가 캐싱은 MoE의 희소성을 실제 추론 속도로 바꾸는 핵심이며, 메모리와 서빙 비용도 줄일 수 있다.