LLM 동작 모니터링: 드리프트, 재시도, 거부 패턴
Monitoring LLM behavior: Drift, retries, and refusal patterns

TL;DR AI
1분핵심 요약
엔터프라이즈 AI는 운영 중 LLM 동작을 체계적으로 모니터링할 계층적 평가 스택이 필요하다.
먼저 저비용의 결정적 테스트로 스키마 오류, 라우팅 문제 같은 명확한 실패를 빠르게 잡아야 한다.
그다음에는 LLM-as-a-Judge를 활용해 의미적 품질을 평가해야 하며, 모델 출력은 확률적이라 변동이 크다.
이런 다층 평가를 통해 환각, 드리프트, 재시도, 거부 패턴을 더 잘 포착하고 컴플라이언스 위험도 줄일 수 있다.
