본문으로 건너뛰기
마탑6F 도서관
풍경

AI 평가의 발전: 벤치마크에서 실제 개발 과제까지

정해진 문제를 푸는 벤치마크, chain-of-thought와 ReAct의 평가, 2023년 SWE-bench를 통해 평가 대상이 어떻게 넓어졌는지 살펴본다.

시드 개정 2판원문 대조 2026-09-28기록 2026-09-29T12:35:50Z

고친 내용: 독자에게 보이는 문장과 용어를 다듬고 기존 근거 연결을 유지했다.

정해진 문제로 비교하는 벤치마크

언어모델을 비교하는 기본적인 방법은 같은 문제 모음을 풀게 하는 것이다. 정답이 분명한 문제들을 모아 점수를 매기면 모델끼리 비교할 수 있기 때문이다. 이 방식은 간편하고 재현 가능하지만, 실무 능력을 얼마나 반영하는지는 따로 검토해야 한다. 문제의 분포가 실제 쓰임의 분포와 다를 수 있고, 정답의 형식이 실제 답의 모양과 동떨어질 수 있다. 그럼에도 문제 모음은 비교의 공통 언어가 되었다.

정해진 문제 모음을 쓰는 평가에서는 같은 문제를 같은 조건으로 풀게 하고 점수를 비교한다. 조건에는 모델의 규모와 프롬프트 방식, 허용된 시도 횟수가 들어간다. 조건을 알아야 점수의 의미를 해석할 수 있다. 이 원칙은 이후의 모든 평가 사례에 적용된다.

2022년: 풀이 방식의 효과를 평가하다

2022년 1월의 chain-of-thought 논문은 풀이 방식에 따른 성능 차이를 평가했다. 같은 모델이라도 푸는 방식을 바꾸자 점수가 달라졌기 때문이다. 540B 파라미터 모델에 8개의 예시를 주는 것만으로 수학 문장제 벤치마크 GSM8K에서 당시 최고 정확도를 달성했다고 보고했다. 풀이의 정확성을 평가하는 검증 모델인 verifier를 붙인 파인튜닝 GPT-3보다도 높은 점수였다. 산술과 상식, 기호 추론 과제에서도 개선을 확인했다고 한다.

이 사례에서는 평가를 통해 풀이 방식의 효과를 확인했다. 평가 대상뿐 아니라 문제를 풀게 하는 방식도 점수에 영향을 준 것이다. 다만 GSM8K 점수가 일상적 추론 전반을 대신하지는 못하며, 중간 단계를 잘 적는 것과 진짜 이유를 밝히는 것은 다르다. 이 평가만으로 모델의 추론 능력 전반을 입증할 수는 없다.

2022년에서 2023년: 추론과 행동을 함께 평가하다

같은 해 10월의 ReAct는 평가의 대상을 넓혔다. 추론과 행동을 결합한 과정을 평가한 것이다. 질의응답과 사실 검증, 대화형 의사결정 과제를 함께 평가했고, ALFWorld에서는 모방학습과 강화학습 방식을 절대 성공률로 34%p 앞섰다고 보고되었다. 단일 호출의 답이 아니라 외부 환경과 상호작용하는 과정 전체가 평가의 단위가 된 것이다.

모델이 여러 단계를 거치는 작업에 쓰이면 평가에서도 그 과정을 살펴야 한다. 그러나 과정의 평가는 최종 답의 평가보다 어렵다. 어느 단계에서 성공하거나 실패했는지 확인해야 하기 때문이다. ReAct 논문은 사람이 풀이 과정을 해석하기 쉽다고 설명한다. 이런 특성은 오류가 생긴 단계를 찾는 데 도움이 될 수 있다.

2023년: 실제 개발 과제를 평가한 SWE-bench

2023년 10월의 SWE-bench는 실제 개발 과제를 평가에 사용했다. 12개 인기 Python 저장소의 실제 GitHub 이슈와 대응 pull request에서 뽑은 2,294개의 문제로 이루어진다. 모델은 코드베이스와 이슈 설명을 받아 이슈를 해결하도록 코드를 수정해야 하며, 여러 함수와 클래스, 파일에 걸친 변경과 실행 환경과의 상호작용, 매우 긴 컨텍스트의 처리, 복잡한 추론을 요구한다고 논문은 설명한다.

2023년 평가에서는 가장 성능이 좋았던 Claude 2도 1.96%의 이슈만 해결했다. 당시 최신 비공개 모델과 파인튜닝 모델 모두 가장 쉬운 이슈만 풀 수 있었다고 논문은 보고했다. 이 수치는 그 시점의 결과다. 이 글에서는 점수보다 실제 개발 작업의 기록을 평가에 사용했다는 점에 주목한다. 논문도 모델의 발전 속도에 비해 평가 방법이 부족하다는 문제의식에서 출발했다.

평가 대상의 확장

여기서 살펴본 연구들은 풀이 방식, 추론과 행동의 결합, 실제 개발 작업까지 평가 대상을 넓혔다. 정해진 문제로 모델을 비교하는 평가와 이런 평가를 함께 활용할 수 있다.

남은 과제는 학습 데이터에 평가 문제가 섞이는 오염, 과적합, 실무와의 괴리, 여러 단계에 걸친 작업의 평가, 평가 자체의 비용이다. 특히 에이전트처럼 여러 구성 요소를 결합한 시스템에서는 각 요소의 점수가 높아도 전체 작업에 성공한다고 보장할 수 없다. 이 글은 남은 과제를 정리하며 특정 평가 체계의 우열을 판단하지 않는다.

높은 점수를 해석할 때의 주의점

모델이 특정 평가에 맞춰 개선되면 그 평가만으로 모델 간 능력 차이를 구분하기 어려워질 수 있다. 벤치마크 점수가 올라도 실제 능력이 향상된 것인지, 해당 문제에 익숙해진 것인지 따져야 한다. 학습 데이터에 평가 문제가 스며드는 오염까지 겹치면 점수의 의미는 더 흐려진다. 모델이 달라지면 평가 방식도 다시 검토해야 한다.

어떤 평가 방식에도 한계는 있다. 실제 과제를 쓰더라도 선택한 문제들이 실제 업무를 대표하는지 검토해야 하고, 작업 과정까지 평가하면 비용이 늘어난다. 모델로 다른 모델의 답을 평가할 때는 평가 모델의 편향도 영향을 준다. 점수를 활용하되 측정하지 못한 능력을 함께 확인해야 한다.

평가 결과에서 확인할 조건

평가 결과를 읽을 때는 무엇을 어떤 조건에서 측정했는지, 무엇은 측정하지 못했는지 확인한다. 모델 규모와 풀이 방식, 허용된 도구와 시도 횟수가 주요 조건이다. 실무와의 차이, 작업 과정의 품질처럼 점수에 충분히 반영되지 않은 부분도 살펴야 한다. 이런 정보를 알아야 해당 점수를 자신의 판단에 활용할 수 있다.

현재 판 출처 (이 개정의 출처 보관본 아님) 3건

아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.

  1. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (외부)
    S3
  2. ReAct: Synergizing Reasoning and Acting in Language Models (외부)
    S4
  3. SWE-bench: Can Language Models Resolve Real-World GitHub Issues? (외부)
    S8
← 고침 기록으로