릴레이 방식으로 전국 연산 자원 활성화, PD 분리가 마침내 돌파구를 찾다: 지연은 절반으로, 비용은 약 40% 절감!
Relay-style orchestration revitalizes national computing power, and PD separation finally breaks through: latency cut in half, costs down nearly 40%!

TL;DR AI
1분핵심 요약
무원심궁은 WAIC 2026 이후 크로스 클러스터 이기종 대형 모델 추론 아키텍처 PDD의 전체 기술 보고서를 공개했다.
PDD는 추론을 Prefill, RelayDecode, MainDecode의 세 단계로 나눠, 로컬 중계 노드가 먼저 디코딩을 시작한 뒤 원격 클러스터가 이어받는다.
이 방식은 WAN 환경에서 KV Cache 전송 지연을 줄이고, RadixCache로 프리픽스 재사용을 통해 클러스터 간 데이터 이동도 더 줄인다.
실측 결과 첫 토큰 지연은 51.5% 감소했고, 토큰당 비용은 37.5% 낮아져 분산 GPU 클러스터를 활용한 서빙이 더 현실적이 됐다.
