넷이즈 게임즈가 LLM 콜드 스타트를 42분에서 30초로 줄인 방법
How NetEase Games cut LLM cold starts from 42 minutes to 30 seconds

TL;DR AI
1분핵심 요약
넷이즈 게임즈는 서버리스 LLM 추론의 핵심 병목이 GPU 스케줄링이 아니라 모델 로딩이라는 점을 확인했다.
직접적인 크로스리전 스토리지 접근을 캐시 계층과 Kubernetes 기반 Fluid 프리페칭으로 바꿔, 모델 로드 시간을 42분에서 30초로 줄였다.
이 개선으로 GPU 인프라에서 오토스케일링과 멀티테넌트 모델 서빙이 훨씬 현실적이 됐다.
이번 사례는 탄력적인 AI 시스템이 연산 자원만큼이나 빠르고 관리하기 쉬운 모델 데이터 접근을 필요로 한다는 점을 보여준다.
