베이비시터, 감사인, 기도. 아니면 시험.
Babysitter, Auditor, Prayer. Or Tests.

TL;DR AI
1분핵심 요약
이 글은 신뢰할 수 있는 LLM 에이전트를 만들려면 프롬프트나 사람의 감독만이 아니라 코드 수준의 테스트와 어서션이 필요하다고 주장한다.
프롬프트 중심의 제어 흐름을 비판하며, 다음 단계나 도구 호출이 실행되기 전에 모델 출력을 검증해야 한다고 말한다.
실용적인 안전장치로는 스키마 검사, predicate, eval, 드라이런, 런타임 어서션 등이 제시된다.
핵심은 LLM 에이전트의 신뢰성을 소프트웨어 테스트 문제로 보고, 위험한 출력이 실행되기 전에 차단하는 것이다.
