역할별 혼합 모델: 에이전트 팀의 비용과 품질 설계
한 가지 모델로 모든 일을 시키는 대신 역할마다 다른 모델을 쓰고, 비용은 토큰 단위로 재고, 품질은 과제에 맞춘 평가로 뒷받침하는 설계의 뼈대를 정리한 개념 글이다.
고친 내용: 초판
문제: 하나로는 비싸고, 하나로는 모자라다
에이전트 흐름이 커지면 한 가지 모델로 모든 단계를 처리하기가 어려워진다. 가장 강한 모델만 쓰면 단순 분류 같은 일에도 큰 비용과 대기 시간이 들고, 가장 빠르고 싼 모델만 쓰면 어려운 판단에서 품질이 무너진다. 어느 한쪽을 고르는 일은 비용과 품질 중 하나를 포기하는 일이 되기 쉽다.
그래서 실무에서는 일을 나누고 모델도 나누는 선택이 나온다. 쉬운 일은 빠르고 가벼운 쪽에, 어려운 일은 신중하고 강한 쪽에 맡기는 것이다. 이 글은 그 나누기의 원칙과, 나누기가 절약인지 손실인지를 가리는 재는 법을 정리한다. 특정 비율이나 특정 요금제를 권하지 않는다.

개념: 역할마다 모델을 정한다
OpenAI의 에이전트 안내가 소개하는 방식은 역할별 지정이다. 전문 역할이 일관되게 다른 품질·지연·비용 양상을 필요로 하면 그 에이전트에 model을 직접 정하고, 한 흐름 전체에 같은 기본값을 덮을 때는 실행 단위의 기본값을 쓰며, 아무것도 정하지 않은 에이전트의 fallback으로는 프로세스 단위의 환경 기본값을 쓴다. 같은 흐름 안에서 빠른 분류 역할과 느긋한 심층 역할이 나란히 사는 혼합이 정상적인 출발점이다.
이 구분의 가치는 코드와 기록에서 흐름이 읽힌다는 데 있다. 누가 어떤 기준으로 일하는지가 선언으로 드러나면, 나중에 비용이 늘었을 때 어느 역할이 문제인지 짚을 수 있다. 반대로 실행 환경의 기본값에 기대면 같은 코드가 환경마다 다르게 굴러가며, 비용과 품질의 책임 소재가 흐려진다. 명시적인 지정이 첫 번째 원칙이다.
이 절의 근거 S24
| 지정 갈래 | 언제 쓴다 | 남는 기록 |
|---|---|---|
| 에이전트별 model 지정 | 전문 역할이 일관되게 다른 품질·지연·비용을 필요로 할 때 | 누가 어떤 기준으로 일하는지 선언에 남는다 |
| 실행 단위 기본값 | 한 흐름 전체에 같은 기본값을 덮을 때 | 흐름 단위의 공통 조건으로 읽힌다 |
| 환경 fallback | 아무것도 정하지 않은 에이전트의 뒷받침 | 환경마다 다르게 굴러가 책임이 흐려질 수 있다 |
표를 글로 읽기
세 행의 표. 에이전트별 model 지정은 전문 역할이 다른 품질·지연·비용 양상을 필요로 할 때 쓰고, 실행 단위 기본값은 한 흐름 전체에 같은 값을 덮을 때 쓰며, 환경 fallback은 아무것도 정하지 않은 에이전트가 기대는 자리라 환경마다 다르게 굴러갈 수 있다.
비용의 뼈대: 토큰 수와 토큰당 단가
운영 안내가 제시하는 비용 사고방식은 단순하다. 비용은 토큰 수와 토큰당 단가의 함수이며, 줄이는 길은 두 갈래다. 토큰당 단가를 낮추는 길, 즉 일부 일을 작은 모델로 옮기는 것과, 토큰 수를 줄이는 길, 즉 짧은 지시와 흔한 질의의 캐싱이다. 혼합 모델은 첫 번째 길에 해당한다.
운영의 받침도 함께 둔다. 지출 알림과 월 상한, 토큰 사용량 판으로 흐름을 감시하고, 강한 모델로 먼저 동작을 확인한 뒤 같은 결과를 내는 작은 모델이 있는지 시험하며, 단계와 운영 환경을 나누어 실험이 실서비스를 건드리지 않게 한다. 상한에 닿으면 해당 API 흐름이 멈출 수 있으므로, 상한은 안전장치이자 동시에 가용성의 조건이다. 이 절차들은 특정 수치가 아니라 운영의 뼈대다.
이 절의 근거 S25
| 비용 갈래 | 재는 것 | 줄이는 길 |
|---|---|---|
| 토큰 수 | 얼마나 많이 읽고 쓰는가 | 짧은 지시와 흔한 질의의 캐싱 |
| 토큰당 단가 | 얼마짜리 모델에 맡기는가 | 일부 일을 작은 모델로 옮기기 |
| 지출 감시 | 얼마 쓰고 어디서 새는가 | 지출 알림·월 상한·사용량 판과 단계·운영 분리 |
표를 글로 읽기
세 행의 표. 토큰 수는 짧은 지시와 흔한 질의의 캐싱으로 줄이고, 토큰당 단가는 일부 일을 작은 모델로 옮겨 낮추며, 지출 감시는 알림·월 상한·사용량 판과 단계·운영 분리로 묶는다.
품질의 뒷받침: 과제에 맞춘 평가
혼합의 품질은 느낌이 아니라 평가로 뒷받침한다. 평가 안내는 세 가지를 강조한다. 첫째, 과제에 맞춘 평가를 쓴다. 학술 지표만으로는 실무 분포를 재현하지 못한다. 둘째, 매 변경마다 상시 평가를 돌리고 로그에서 평가 사례를 캐낸다. 셋째, 점수와 사람 판단을 함께 본다. 0과 1 사이의 점수는 답의 일부이며, 무엇이 옳은지를 정하는 일에는 사람의 판단이 들어간다.
사람 평가와 모델 판정의 분업도 분명하다. 사람 평가는 가장 질이 높지만 느리고 비싸고, 모델 판정은 싸고 확장되지만 과제마다 들쭉날쭉하다. 그래서 모델 판정을 쓰기 전에 사람 표식과의 합의를 먼저 맞추고, 합의가 확인된 뒤에 규모를 키운다. 편향된 설계, 즉 운영 흐름을 닮지 않은 평가 자료는 처음부터 피해야 할 함정이다. 평가는 목적지가 아니라 계속 도는 과정이다.
이 절의 근거 S26
따라가기: 가상의 지원 처리 흐름
아래는 실행하지 않은 가상의 따라가기이며, 비율과 수치는 예시용 가정이고 측정값이 아니다. 어떤 상점의 지원 흐름에 세 역할이 있다고 하자. 접수 분류는 빠르고 가벼운 모델이 맡아 문의의 종류와 긴급도를 가린다. 심층 조사는 강한 모델이 맡아 주문 기록과 정책을 읽고 해결안을 짠다. 마무리 판정은 다시 가벼운 쪽이 맡아 정해진 점검표대로 답을 다듬는다.
이 흐름의 재는 법은 역할마다 다르다. 분류는 정답 갈래와의 일치율, 조사는 해결율과 정책 인용의 정확함, 마무리는 점검표 통과율로 잰다. 그리고 세 역할의 답을 사람이 주기적으로 다시 보고 사람과의 합의를 잰다. 합의가 깨진 역할부터 손본다. 이 순서를 밟으면 비용과 품질 목표를 달성했는지를 판단할 수 있고, 순서를 건너뛰면 어느 역할이 어긋났는지 알기 어려워 판단의 근거가 옅어진다.
그림을 글로 읽기
다섯 상자를 잇는 흐름도. 1 접수 들어옴이 분류 역할로 간다(일). 2 분류 역할(가벼운 모델)이 종류·긴급도를 가려 심층 역할로 넘긴다(일). 3 심층 역할(강한 모델)이 기록·정책을 읽고 해결안을 짜 마무리 역할로 넘긴다(일). 4 마무리 역할(점검표)이 답을 다듬어 나간다(일). 5 사람 합의 맞춤이 세 역할 곁에 따로 서서 분류·심층·마무리를 각각 재기한다(평가): 분류 일치율, 심층 해결·인용, 점검표 통과율.
실패 양상과 한계
혼합이 깨지는 자리는 정해져 있다. 분류가 틀리면 강한 모델이 엉뚱한 일을 비싸게 하고, 심층이 약하면 싼 분류의 절약이 무색해지며, 마무리 점검표가 부실하면 앞의 노력이 말단에서 샌다. 어느 역할의 실패인지 알려면 역할별 평가가 있어야 하며, 전체 점수 하나로는 원인을 가릴 수 없다.
한계도 분명히 한다. 고정된 분담 비율은 이 글의 주장이 아니다. 비율은 과제의 분포가 정하는 것이며, 분포가 바뀌면 비율도 다시 재야 한다. 특정 요금제를 기밀 업무에 쓰는 일은 권하지 않는다. 각 요금제의 자료 이용 조건을 운영 문서에서 직접 확인하는 일이 먼저이며, 이 글은 어떤 요금제도 특정하지 않는다. 속도 추정 역시 실행 환경에 묶인 값이므로, 한 환경의 빠르기가 다른 환경의 빠르기를 보증하지 않는다.
측정과 검증 계획
혼합을 도입하는 팀은 다음 순서로 밟는다. 먼저 전부 강한 모델로 기준선을 잰다. 다음으로 과제를 닮은 평가 자료를 모으고 역할별 점수를 정한다. 그 다음 혼합 후보를 올려 기준선과 견주고, 사람 표식과의 합의를 맞춘다. 마지막으로 지출 상한과 사용량 감시를 걸고 운영에 낸다. 각 단계의 통과 기준을 미리 적어두면 나중에 비율을 바꿀 때도 같은 잣대로 견줄 수 있다.
검증의 적은 한 번 재고 마는 일이다. 분포는 바뀌고 모델도 바뀌므로, 상시 평가가 돌지 않는 혼합은 시간이 지날수록 근거 없는 혼합이 된다. 평가 자료를 로그에서 계속 캐내는 일이 혼합의 유지보수다.
| 역할 | 묻는 것 | 재는 법 |
|---|---|---|
| 분류 | 갈래를 맞게 가렸는가 | 정답 갈래와의 일치율 |
| 심층 | 문제를 풀었는가 | 해결율·정책 인용 정확함 |
| 마무리 | 답이 점검표를 통과하는가 | 점검표 통과율 |
| 사람 합의 | 자동 점수와 사람이 같은가 | 주기적 재검토·합의율 |
표를 글로 읽기
네 행의 표. 분류 역할은 일치율을, 심층 역할은 해결율과 인용 정확함을, 마무리 역할은 점검표 통과율을, 사람 합의는 주기적 재검토를 잰다.
결론: 나누고, 재고, 감시한다
역할별 혼합의 원칙은 세 마디다. 역할마다 모델을 명시하고, 과제에 맞춘 평가로 품질을 뒷받침하고, 지출 감시로 비용을 묶는다. 이 세 가지가 갖춰지면 혼합은 설계가 되고, 하나라도 빠지면 혼합은 도박이 된다.
이 글의 바깥에 남는 것도 적어둔다. 어떤 비율이 최선인지, 어떤 요금제가 적당한지는 각 팀의 분포와 조건이 정할 일이다. 서가가 줄 수 있는 것은 비율이 아니라 비율을 정하는 절차뿐이다. 에이전트의 기본 문법은 에이전트와 도구 사용 글에, 평가의 일반론은 평가 글에 있으니 함께 읽기를 권한다.
현재 판 출처 (이 개정의 출처 보관본 아님) 4건
아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.