이전 목록

넷플릭스의 자체 LLM 서빙

In-House LLM Serving at Netflix

TL;DR AI

핵심 요약

1분
  1. 넷플릭스는 vLLM, Triton, 그리고 공유형 프로덕션 인퍼런스 스택을 활용해 내부 LLM 서빙 플랫폼을 구축·운영하는 방식을 공개했다.

  2. 회사는 호스팅된 외부 API 대신 자체 프로덕션 스택에서 LLM 추론을 실행해 성능과 운영에 대한 통제력을 높이고 있다.

  3. 핵심 기술 선택은 vLLM, NVIDIA Triton 연동, 통합 서빙, GPU 백엔드 공유, 무중단 배포 워크플로우다.

  4. 이번 사례는 더 나은 확장성, 배포 유연성, 운영 트레이드오프 관리를 위해 자체 인퍼런스로 옮겨가는 흐름을 보여준다.

원문 보기