LLM 서빙 공정성: 더 이상 소음이 큰 이웃은 없다 | Cohere
LLM Serving Fairness: No More Noisy Neighbors | Cohere

TL;DR AI
1분핵심 요약
Cohere는 GPU 기반 공유 LLM 추론을 위한 공정성 시스템을 공개했다.
이 설계는 요청 허용 제어, 서비스 티어, Deficit Round Robin 스케줄링을 결합한다.
한 테넌트의 트래픽 급증이 다른 고객을 밀어내지 못하게 하는 것이 목표다.
배칭 효율은 유지하면서 우선순위와 마감 순서는 지키도록 설계됐다.


