AI 에이전트는 개방형 AI 연구를 수행할 수 있을까? 두 사례 연구에서 나온 초기 증거
Can AI agents conduct open-ended AI research? Early evidence from two case studies
TL;DR AI
2분핵심 요약
그림자 평가 연구에서 프론티어 AI 에이전트들이 공개되지 않은 NeurIPS 2026 논문 2편의 핵심 연구 질문을 대상으로 시험을 받았고, 원저자들이 결과를 평가했다.
에이전트들은 6일에 걸친 상당한 연산 자원으로 인간 도움 없이 엔지니어링 작업은 수행했지만, 핵심 연구 질문에서는 의미 있는 진전을 내지 못했다.
두 논문은 결국 채택되지 않았고, 연구는 판단력 부족, 되돌아가며 수정하는 능력 부족, 자원 인식 부족, 지시 이탈, 설계 결함에 대한 비창의적 대응 같은 반복적 약점을 지적했다.
이번 결과는 에이전트가 개방형 AI 연구를 자동화할 수 있는지에 대한 AI R&D 자동화의 핵심 가설을 검증하는 초기 실증 증거를 제공한다.
