DeepSWE AI 코딩 모델 벤치마크, 마침내 AI 학습 데이터 오염 문제 해결
DeepSWE AI Coding Model Benchmark Finally Solves AI Training Data Contamination

TL;DR AI
1분핵심 요약
DataCurve가 수작업으로 만든 비오염 코딩 과제 기반의 새로운 AI 코딩 벤치마크 DeepSWE를 출시했다.
이 벤치마크는 TypeScript, Go, Python, JavaScript, Rust 등 5개 언어의 91개 오픈소스 저장소에서 과제를 추출했다.
검증 체크를 적용해 오류를 줄이고, 실제 소프트웨어 작업에 더 가까운 성능을 평가한다.
GPT 5.5가 전체적으로 가장 강력한 모델로 나타났다.
DeepSWE는 학습 데이터 유출을 줄여 AI 코딩 모델 비교를 더 신뢰할 수 있게 하려는 목적이다.



