SWE-bench 공개 (2023)
2023년 10월 10일 arXiv에 공개된 SWE-bench의 기록. 실제 GitHub 이슈 기반 2,294문제 평가의 구성과 2023년 보고를 다룬다.
고친 내용: 초판
평가가 뒤처진 시절
언어모델의 개발 속도는 평가의 발전 속도를 앞질렀다. 모델이 풀 수 있는 일은 넓어지는데, 그 능력을 재는 무대는 인공 문제에 머물러 있었다. 논문의 첫 문장은 이 사정을 단적으로 드러낸다. 언어모델이 우리의 평가 능력마저 앞질렀다는 것이다. 평가가 실제에 닿아야 한다는 요구가 커졌다.
사건: 벤치마크의 공개
2023년 10월 10일, Jimenez 등은 arXiv에 SWE-bench: Can Language Models Resolve Real-World GitHub Issues?를 공개했다. 12개 인기 Python 저장소의 실제 GitHub 이슈와 대응 pull request에서 뽑은 2,294개의 문제로 이루어진다. 모델은 코드베이스와 이슈 설명을 받아 이슈를 해소하는 편집을 해야 한다. 여러 함수와 클래스, 파일에 걸친 변경과 실행 환경과의 상호작용, 매우 긴 컨텍스트의 처리, 복잡한 추론을 요구한다고 논문은 설명한다.
2023년의 보고
2023년 평가 시점의 보고는 겸허했다. 최고 성능 모델인 Claude 2도 1.96%의 이슈만 해결했고, 최신 proprietary 모델과 파인튜닝 모델 SWE-Llama 모두 가장 쉬운 이슈만 풀 수 있었다는 것이다. 이 수치는 그 시점의 스냅샷이며, 이후 점수는 이 서가의 출처 범위에 없다.
해석의 주의
SWE-bench의 의의는 점수보다 발상에 있다는 것이 이 기록의 해석이다. 인공 문제 대신 실제 작업의 흔적을 평가 재료로 쓴 것이다. 다만 실제 과제라고 해서 평가의 숙제가 사라지지 않는다. 이슈의 분포가 실무 전반을 대신하지는 못하며, 테스트 통과가 곧 올바른 수정이라는 보장도 완전하지 않다. 평가는 여전히 불완전한 나침반이다.
실무의 시사점
자신의 일을 재는 평가가 필요하다면 실제 흔적을 먼저 본다. 해결된 이슈와 그 수정, 오간 논의와 테스트의 기록이 평가의 재료가 된다. 인공 문제를 새로 만들기 전에 이미 쌓인 흔적을 살피는 것이 순서다. 다만 흔적의 편향을 함께 적어야 한다. 어떤 일이 기록에 남고 어떤 일이 남지 않는지를 모르면 점수가 현재를 대신하지 못한다.
현재 판 출처 (이 개정의 출처 보관본 아님) 1건
아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.