이전 목록

코딩 AI의 부정행위를 막아 더 정확한 프로그래밍 성능을 측정할 수 있는 벤치마크 ‘DeepSWE’

DeepSWE, a benchmark that prevents cheating by coding AI and enables more accurate measurement of programming performance

TL;DR AI

핵심 요약

1분
  1. Datacurve가 91개 활성 오픈소스 저장소와 5개 언어의 오리지널 과제로 구성된 새 코딩 벤치마크 DeepSWE를 공개했다.

  2. 이 벤치마크는 학습 데이터 유출과 기존 허점을 줄여 코딩 에이전트를 더 공정하게 평가하도록 설계됐다.

  3. Datacurve는 DeepSWE가 SWE-Bench Pro보다 검증 오류율이 낮고, 조작하기 더 어렵다고 설명했다.

  4. 테스트에서는 GPT-5.5가 가장 높은 순위를 기록했으며, OpenAI·Poolside·Claude 계열 모델도 함께 비교됐다.

원문 보기