본문으로 건너뛰기
마탑6F 도서관
풍경

SWE-bench 공개 (2023)

SWE-bench는 실제 GitHub 이슈에서 뽑은 2,294문제로 소프트웨어 수정 능력을 평가한다. 2023년 10월 10일 arXiv에 공개된 평가의 구성과 2023년에 보고한 결과를 정리한다.

사건 기록사건일 2023-10-10발행 2026-09-28원문 대조 2026-09-285분 읽기

개정 2판 · 최근 고침: 독자에게 보이는 문장과 용어를 다듬고 기존 근거 연결을 유지했다. · 고침 기록 보기

arXiv 최초 제출일(2023-10-10)을 기준으로 작성한 과거 연구 기록이다. 1.96%는 2023년 평가 시점의 수치이며 현재의 성능을 뜻하지 않는다.

실제 작업을 평가할 필요성

언어모델의 개발 속도가 평가의 발전 속도를 앞지르면서 모델이 수행하는 일과 평가 문제 사이에 차이가 생겼다. 수행할 수 있는 과제는 늘었지만 평가에는 인공적으로 만든 문제가 주로 쓰였다. 논문의 첫 문장도 언어모델이 우리의 평가 능력을 앞질렀다고 지적한다. 실제 작업을 얼마나 해결하는지 확인할 평가가 필요해졌다.

SWE-bench 공개

2023년 10월 10일, Jimenez 등은 arXiv에 SWE-bench: Can Language Models Resolve Real-World GitHub Issues?를 공개했다. 널리 사용되는 12개 Python 저장소에서 실제 GitHub 이슈와 그에 대응하는 코드 변경 제안인 pull request를 모아 2,294개의 문제를 구성했다. 모델은 프로젝트의 코드 전체인 코드베이스와 이슈 설명을 받아 문제를 해결하도록 코드를 수정해야 한다. 논문은 여러 함수·클래스·파일을 고치고 실행 환경과 상호작용하며, 매우 긴 컨텍스트를 처리하고 복잡한 추론을 해야 하는 평가라고 설명한다.

2023년 평가에서 보고한 결과

2023년 평가에서 가장 성능이 높았던 Claude 2도 이슈의 1.96%만 해결했다. 당시 최신 비공개 모델과 추가 데이터로 조정한 파인튜닝 모델 SWE-Llama 모두 가장 쉬운 이슈만 풀 수 있었다고 보고했다. 이 수치는 그 시점의 결과이며, 이후 점수는 이 글에서 확인한 출처의 범위를 벗어난다.

실제 이슈를 사용해도 남는 한계

이 글에서는 SWE-bench가 점수뿐 아니라 실제 작업 기록을 평가에 활용했다는 점에 의미가 있다고 본다. 다만 실제 이슈를 사용해도 평가의 한계는 남는다. 수집한 이슈의 분포가 실무 전체를 대표하지 못할 수 있고, 테스트를 통과했다고 해서 수정이 완전히 올바르다고 보장할 수도 없다. 평가 결과는 이런 한계와 함께 해석해야 한다.

업무 기록으로 평가 만들기

자신의 업무를 평가하려면 이미 해결한 이슈와 수정 내용, 논의와 테스트 기록부터 살펴볼 수 있다. 인공 문제를 새로 만들기 전에 축적된 기록을 평가 자료로 활용하는 것이다. 다만 기록에 어떤 업무가 남고 어떤 업무가 빠졌는지 함께 밝혀야 한다. 그 편향을 모르면 점수가 현재의 업무 능력을 얼마나 반영하는지 판단하기 어렵다.

근거 출처 1건

  1. [1] 12개 저장소의 2,294개 문제로 구성한 평가와 Claude 2의 1.96% 해결률 보고
    SWE-bench: Can Language Models Resolve Real-World GitHub Issues? (외부)
    arXiv:2310.06770 · 2023-10-10

함께 읽기

← 서가 처음으로