프론티어 AI 모델, 문서 내용의 25%를 훼손
Frontier AI models corrupt 25% of document content

TL;DR AI
1분핵심 요약
마이크로소프트 연구진은 52개 전문 분야의 되돌릴 수 있는 다단계 문서 작업을 평가하는 벤치마크 DELEGATE-52를 공개했다.
최상위 프런티어 AI 모델들은 반복 편집 과정에서 눈에 띄지 않는 오류를 쌓아 올리며 문서를 평균 약 25% 수준으로 훼손했다.
도구나 방해 문서를 추가하자 성능은 더 나빠져, 위임형 문서 작업에서의 신뢰성이 낮다는 점이 드러났다.
이번 결과는 자율성, 반복 수정, 장기 워크플로가 필요한 고위험 지식 업무에 현재 모델을 바로 쓰기 어렵다는 우려를 키운다.
