언어 바꾸기English
이전 목록

Scale Labs, AI용 새 리팩토링 리더보드 공개

Scale Labs debuts new Refactoring Leaderboard for AI

TL;DR AI

핵심 요약

2분
  1. Scale Labs가 SWE Atlas의 마지막 구성으로 Refactoring Leaderboard를 공개해, 대규모 코드베이스에서 AI 코딩 에이전트의 실제 리팩터링 능력을 평가한다.

  2. 이 벤치마크는 단순한 코딩 프롬프트가 아니라 여러 파일에 걸친 동작 보존 수정, 정리, 유지보수성을 측정한다.

  3. 현재 Claude Code의 Opus 4.7이 1위이며, ChatGPT 5.5가 그 뒤를 잇고 있다.

  4. 연구 결과, 최상위 폐쇄형 모델이 오픈 모델보다 우수했지만, 반복 실행 때마다 결과가 달라지는 신뢰성 문제는 여전히 크다.

  5. 이번 벤치마크는 테스트 통과를 넘어 코드 품질, 재현성, 실무형 엔지니어링 역량을 강조해 기업용 평가 기준을 높였다.

원문 보기