모델 교체 없이 에이전트 지연 시간을 30초에서 8초로 줄이기
Cutting agent latency from 30s to 8s without model swap

TL;DR AI
1분핵심 요약
AI 채팅 팀은 모델을 바꾸지 않고 p95 지연 시간을 31초에서 8초로 줄였다.
지연의 약 35%만 모델 때문이었고, 대부분은 순차적 툴 호출, 불필요한 LLM 단계, 스트리밍 부재에서 발생했다.
독립적인 조회를 병렬화하고, LLM critic을 결정론적 검증으로 대체했으며, 응답을 스트리밍했다.
그 결과 이탈률이 70% 감소했고, 모델 속도보다 오케스트레이션이 더 중요할 수 있음을 보여줬다.
