평가의 진화사: 문제 모음에서 실제 과제까지
정적 벤치마크로 재던 시절부터 chain-of-thought의 평가 사례, 2023년 SWE-bench의 실제 과제 평가까지 평가의 무대가 어떻게 옮겨갔는지 따라가는 발전 과정 에세이다.
고친 내용: 초판
재는 일의 시작: 문제 모음
언어모델의 평가는 문제 모음으로 시작했다. 정답이 분명한 문제들을 모아 점수를 매기면 모델끼리 비교할 수 있기 때문이다. 이 방식은 간편하고 재현 가능하지만, 실무와의 거리가 숙제로 남는다. 문제의 분포가 실제 쓰임의 분포와 다를 수 있고, 정답의 형식이 실제 답의 모양과 동떨어질 수 있다. 그럼에도 문제 모음은 비교의 공통 언어가 되었다.
이 시기의 평가는 대개 정적이었다. 같은 문제를 같은 조건으로 풀게 하고 점수를 견준다. 조건에는 모델의 규모와 프롬프트 방식, 허용된 시도 횟수가 들어간다. 조건이 빠진 점수는 반쪽짜리 정보다. 이 원칙은 이후의 모든 평가 사례에 적용된다.
2022년: 푸는 방식까지 재기
2022년 1월의 chain-of-thought 논문은 평가의 의미를 넓혔다. 같은 모델이라도 푸는 방식을 바꾸자 점수가 달라졌기 때문이다. 540B 파라미터 모델에 8개의 예시를 주는 것만으로 수학 단어 문제 벤치마크 GSM8K에서 당시 최고 정확도를 달성했고, verifier를 붙인 파인튜닝 GPT-3까지 넘었다고 보고되었다. 산술과 상식, 기호 추론 태스크 범위에서도 개선을 확인했다는 것이다.
이 사례는 평가가 모델의 등급을 매기는 일을 넘어 방법의 가치를 드러낼 수 있음을 보였다. 무엇을 재는가와 함께 어떻게 풀게 하는가가 점수를 가른 것이다. 다만 GSM8K 점수가 일상적 추론 전반을 대신하지는 못하며, 중간 단계를 잘 적는 것과 진짜 이유를 밝히는 것은 다르다. 평가는 거울이지 증명이 아니다.
2022년에서 2023년: 엮인 능력을 재기
같은 해 10월의 ReAct는 평가의 대상을 넓혔다. 생각만이 아니라 생각과 행동을 엮은 과정을 잰 것이다. 질의응답과 사실 검증, 대화형 의사결정 과제를 함께 평가했고, ALFWorld에서는 모방학습과 강화학습 방식을 절대 성공률로 34%p 앞섰다고 보고되었다. 단일 호출의 답이 아니라 외부와 오가는 과정 전체가 평가의 단위가 된 것이다.
이 확장은 필연이었다. 모델의 쓰임이 단일 답 생성에서 연쇄 작업으로 넓어지자, 평가도 그 뒤를 쫓아야 했기 때문이다. 그러나 과정의 평가는 답의 평가보다 어렵다. 어디서 잘했고 어디서 틀렸는지를 가리는 일이 만만치 않다. ReAct가 풀이 궤적의 해석 가능성을 내세운 것은 이 어려움에 대한 답의 하나다.
2023년: 실제 과제의 무대
2023년 10월의 SWE-bench는 평가의 무대를 실제 과제로 옮겼다. 12개 인기 Python 저장소의 실제 GitHub 이슈와 대응 pull request에서 뽑은 2,294개의 문제로 이루어진다. 모델은 코드베이스와 이슈 설명을 받아 이슈를 해소하는 편집을 해야 하며, 여러 함수와 클래스, 파일에 걸친 변경과 실행 환경과의 상호작용, 매우 긴 컨텍스트의 처리, 복잡한 추론을 요구한다고 논문은 설명한다.
2023년 평가 시점의 보고는 겸허했다. 최고 성능 모델인 Claude 2도 1.96%의 이슈만 해결했고, 최신 proprietary 모델과 파인튜닝 모델 모두 가장 쉬운 이슈만 풀 수 있었다는 것이다. 이 수치는 그 시점의 스냅샷이다. SWE-bench의 의의는 점수보다 발상에 있다는 것이 이 글의 해석이다. 인공 문제 대신 실제 작업의 흔적을 평가 재료로 쓴 것이다. 논문의 첫 문장이 말하듯, 모델이 평가 능력을 앞지른 시대에 평가는 실제에 닿아야 했다.
진화사의 요약
평가의 무대는 이렇게 옮겨갔다. 정적 문제 모음에서 푸는 방식의 평가로, 단일 답에서 엮인 과정으로, 인공 과제에서 실제 과제로. 각 단계는 이전을 버린 것이 아니라 잴 수 있는 것을 넓힌 것이다. 오늘의 평가는 이 층들을 함께 쓴다.
남은 숙제는 오염과 과적합, 실무와의 괴리, 긴 연쇄 작업의 평가, 평가 자체의 비용이다. 특히 에이전트처럼 여러 부품을 엮은 시스템에서는 전체 성공과 부품 점수의 관계가 단순하지 않다. 이 서가는 숙제의 목록까지만 정리한다. 특정 평가 체계의 우열을 판단하는 일은 서가의 몫이 아니다.
평가자와 피평가자의 경주
평가의 역사에는 아이러니가 깔려 있다. 평가가 좋아지면 모델은 그 평가에 맞춰지고, 맞춰진 평가의 변별력은 떨어진다. 벤치마크의 점수가 오르는 것이 능력의 향상인지 평가의 소모인지를 가리기는 어렵다. 학습 데이터에 평가 문제가 스며드는 오염까지 겹치면 점수의 의미는 더 흐려진다. 평가자와 피평가자는 서로를 갉아먹으며 앞으로 나간다.
이 경주에서 벗어나는 길은 하나로 보이지 않는다. 실제 과제로 무대를 옮겨도 분포의 대표성 문제가 남고, 과정을 재자니 비용이 치솟는다. 모델로 모델을 재는 길도 열렸지만, 재는 자의 편향이 그대로 스며든다. 그래서 평가의 역사가 주는 교훈은 겸손이다. 점수는 필요하지만 점수만으로는 부족하고, 잴 수 없는 것을 잊지 않는 한에서만 점수가 의미를 가진다는 것이다.
점수 앞에서 묻는 질문
어떤 점수를 만나든 먼저 묻는다. 무엇을 재었는가. 어떤 조건에서 재었는가. 무엇을 재지 못했는가. 조건에는 규모와 푸는 방식, 허용된 도구와 시도 횟수가 들어간다. 재지 못한 것에는 실무와의 거리와 과정의 품질이 들어간다. 이 질문들에 답이 없으면 점수는 구경거리다. 답이 있으면 점수는 나침반이 된다. 불완전한 나침반이지만 없는 것보다는 낫다. 이 진화사가 점수 읽는 법으로 남기는 전부다.
현재 판 출처 (이 개정의 출처 보관본 아님) 3건
아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.