본문으로 건너뛰기
마탑6F 도서관
풍경

역할별 혼합 모델: 에이전트 팀의 비용과 품질 설계

역할마다 다른 모델을 배정하고, 토큰 사용량과 단가로 비용을 계산하며, 실제 과제에 맞춘 평가로 품질을 확인하는 방법을 살펴본다.

시드 개정 2판원문 대조 2026-09-29기록 2026-09-29T12:51:24Z

고친 내용: 독자에게 보이는 문장과 용어를 다듬고 기존 근거 연결을 유지했다.

모든 역할에 같은 모델을 쓸 때 생기는 문제

에이전트가 처리하는 작업이 많아지면 한 가지 모델로 모든 단계를 맡기기 어려워진다. 성능이 높은 모델만 쓰면 단순 분류에도 비용과 대기 시간이 많이 들고, 빠르고 저렴한 모델만 쓰면 어려운 판단에서 품질이 떨어질 수 있다. 역할마다 필요한 성능이 달라 비용과 품질 목표를 함께 맞추기 어려운 것이다.

실무에서는 쉬운 일은 빠르고 가벼운 모델에, 어려운 일은 판단 성능이 더 높은 모델에 맡기는 방법을 쓴다. 이렇게 역할을 나눴을 때 비용이 줄고 품질도 유지되는지 확인하려면 측정 기준이 필요하다. 여기서는 특정 비율이나 요금제를 권하기보다 그 기준을 세우는 방법을 살펴본다.

세 역할의 분담을 그린 개념도개념 편집 일러스트 · 실제 화면·공식 구조도 아님마탑 편집부가 만든 개념 일러스트다. 경량 모델의 분류, 고성능 모델의 조사, 점검표에 따른 최종 검토를 빛줄기로 이어진 세 책상으로 표현했다. 실제 모델 제품 화면이나 공식 구조도가 아니다.마탑 편집부 생성 개념도 · 편집부 일러스트(실제 화면 아님)근거 S24 · S26
마탑 편집부가 만든 개념 일러스트다. 도서관 회랑에 놓인 세 책상이 빛줄기로 이어져 있다. 왼쪽 책상에는 카드 분류함과 카드 무더기가 있고, 가운데 책상에는 확대경 아래 펼쳐진 원고와 모래시계, 책 무더기가 있다. 오른쪽 책상에는 점검표를 세운 받침대와 서류 묶음이 놓여 있다. 배경에는 녹색 스탠드등과 지구본, 책장이 보인다. 실제 제품 화면이나 공식 구조도가 아니다.

역할별 모델 지정

OpenAI의 에이전트 안내는 역할마다 모델을 지정하는 방법을 설명한다. 특정 역할에 필요한 품질·지연 시간·비용 조건이 일관되게 다르면 해당 에이전트의 model을 직접 설정한다. 실행 전체에 같은 모델을 적용할 때는 실행 단위 설정을 쓰고, 별도 설정이 없는 에이전트에는 프로세스에 설정한 기본 모델이 적용된다. 빠른 분류 담당과 시간을 들여 분석하는 조사 담당이 한 흐름 안에서 서로 다른 모델을 쓰는 식이다.

모델을 명시하면 코드와 실행 기록에서 각 역할의 조건을 확인할 수 있다. 비용이 늘었을 때 어느 역할에서 사용량이 증가했는지도 짚기 쉽다. 실행 환경의 기본값에만 의존하면 같은 코드도 환경에 따라 다른 모델로 동작하므로, 비용과 품질의 차이를 추적하기 어려워진다.

이 절의 근거 S24

모델을 지정하는 위치에이전트별 model 설정, 실행 단위 설정, 환경 기본값은 적용 범위가 다르다. 설정 위치를 명시하면 어느 모델이 비용과 품질에 영향을 주는지 추적하기 쉽다. 공식 안내의 구분을 정리한 표이며 특정 비율이나 요금제를 권하지 않는다.근거 S24
설정 위치사용하는 경우확인할 내용
에이전트별 model 설정역할마다 필요한 품질·지연 시간·비용이 다를 때각 역할이 사용하는 모델을 코드에 명시한다
실행 단위 설정실행 전체에 같은 모델을 적용할 때실행 단위의 공통 조건을 확인한다
환경 기본 모델에이전트에 별도 설정이 없을 때환경에 따라 모델이 달라질 수 있다
표를 글로 읽기

에이전트별 model 설정은 역할마다 다른 모델이 필요할 때 사용한다. 실행 단위 설정은 실행 전체에 같은 모델을 적용한다. 별도 설정이 없는 에이전트에는 환경에 설정한 기본 모델이 적용된다.

토큰 사용량과 단가로 계산하는 비용

운영 안내는 비용을 토큰 수와 토큰당 단가로 설명한다. 일부 일을 작은 모델로 옮기면 단가를 낮출 수 있고, 프롬프트를 간결하게 쓰거나 반복되는 질의를 캐싱하면 토큰 사용을 줄일 수 있다. 혼합 모델은 이 가운데 일부 작업의 단가를 낮추는 방법이다.

지출 알림과 월 상한, 토큰 사용량 대시보드로 비용을 확인한다. 먼저 성능이 높은 모델로 동작을 확인한 뒤 같은 결과를 내는 작은 모델이 있는지 시험한다. 실험은 실제 서비스와 분리된 사전 검증 환경에서 진행한다. 지출 상한에 도달하면 해당 API 작업이 중단될 수 있으므로, 상한을 정할 때는 비용뿐 아니라 서비스가 중단될 가능성도 고려해야 한다.

이 절의 근거 S25

비용 항목과 관리 방법토큰 사용량과 단가를 줄이는 방법을 함께 검토한다. 작은 모델에 일부 작업을 맡겨 단가를 낮추고, 프롬프트와 캐싱을 조정하며, 지출 알림과 상한으로 비용을 관리한다. 상한에 도달하면 실행이 중단될 수 있다. 실제 비용 측정값은 제시하지 않는다.근거 S25
관리 항목측정할 내용관리 방법
토큰 수입력과 출력에 사용한 토큰 수간결한 프롬프트와 반복 질의 캐싱
토큰당 단가작업에 배정한 모델의 단가일부 작업을 작은 모델에 배정
지출 관리전체 비용과 사용량지출 알림·월 상한·사용량 대시보드, 사전 검증 환경과 실제 서비스 환경 분리
표를 글로 읽기

토큰 사용량, 토큰당 단가, 지출 관리의 세 항목을 정리한 표다. 프롬프트와 캐싱 조정, 작은 모델 사용, 지출 알림과 월 상한, 사용량 대시보드, 사전 검증 환경과 실제 서비스 환경의 분리를 설명한다.

실제 과제로 품질 평가하기

모델을 조합했을 때의 품질은 실제 과제로 평가한다. 평가 안내는 과제에 맞춘 평가, 변경할 때마다 수행하는 지속적인 평가, 사람의 판단을 함께 강조한다. 학술 지표만으로 실제 업무의 과제 분포를 재현하기는 어렵다. 운영 로그에서 평가 사례를 모으고, 0과 1 사이의 점수로 나타낸 결과도 사람이 내린 판단과 함께 해석해야 한다.

사람의 평가는 품질이 높지만 시간과 비용이 많이 든다. 모델 판정은 적은 비용으로 규모를 늘릴 수 있으나 과제마다 정확도가 다르다. 모델 판정을 본격적으로 사용하기 전에 사람이 매긴 정답과 얼마나 일치하는지 확인해야 한다. 평가 자료도 실제 운영에서 들어오는 과제를 반영해야 하며, 이 평가는 운영 중에도 계속한다.

이 절의 근거 S26

가상 예시: 고객 문의를 처리하는 세 역할

아래는 실제로 실행하지 않은 가상 예시이며, 비율과 수치는 예시용 가정이고 측정값이 아니다. 한 상점의 고객 지원에 세 역할이 있다고 가정하자. 분류 담당은 빠르고 가벼운 모델로 문의 종류와 긴급도를 판단한다. 조사 담당은 성능이 높은 모델로 주문 기록과 정책을 읽고 해결안을 작성한다. 최종 검토 담당은 다시 가벼운 모델로 정해진 점검표에 따라 답변을 확인한다.

분류 담당은 정답 분류와의 일치율, 조사 담당은 해결률과 정책 인용 정확도, 최종 검토 담당은 점검표 통과율로 평가한다. 각 역할의 결과를 사람이 주기적으로 다시 검토해 자동 평가와의 일치도도 확인한다. 차이가 큰 역할부터 조정하면 어느 부분이 비용과 품질 목표를 충족하지 못했는지 파악하기 쉽다.

고객 문의의 분류·조사·최종 검토가상의 고객 지원 사례다. 분류 담당이 문의를 나누고, 조사 담당이 어려운 문의의 해결안을 작성하며, 최종 검토 담당이 점검표에 따라 답을 확인한다. (작업) 화살표는 작업 전달을, (평가) 화살표는 각 역할의 결과를 사람의 판정과 비교하는 과정을 나타낸다. 평가 화살표는 고객에게 보내는 응답 경로가 아니다.근거 S24 · S26
문의 접수에서 분류 담당, 조사 담당, 최종 검토 담당으로 작업이 전달되는 흐름도다. 세 담당자는 각각 사람의 판정과 비교하는 단계에도 연결된다. 평가 항목은 분류 일치율, 해결률과 인용 정확도, 점검표 통과율이다.접수(작업)어려운 문의전달(작업)해결안 전달(작업)점검표 통과율측정(평가)분류 일치율측정(평가)해결률·인용 정확도측정(평가)문의 접수고객 문의와 요청 접수분류 담당경량 모델로 문의 유형 분류조사 담당판단 성능이 높은 모델·기록 조사최종 검토 담당점검표에 따른 답변 확인사람의 판정과 비교역할별 평가 결과 재검토
그림을 글로 읽기

문의 접수에서 분류 담당, 조사 담당, 최종 검토 담당으로 작업이 전달되는 흐름도다. 세 담당자는 각각 사람의 판정과 비교하는 단계에도 연결된다. 평가 항목은 분류 일치율, 해결률과 인용 정확도, 점검표 통과율이다.

실패 양상과 한계

여러 모델을 조합하면 역할마다 다른 실패가 생긴다. 분류가 틀리면 조사 담당 모델이 잘못 배정된 문의를 처리하면서 불필요한 비용을 쓴다. 조사 품질이 낮으면 분류에서 비용을 아껴도 전체 답변의 품질을 유지하기 어렵고, 마무리 점검표가 부실하면 앞 단계의 오류가 최종 답변까지 전달된다. 어느 역할에서 실패했는지 알려면 역할별 평가가 필요하다. 전체 점수 하나로는 원인을 구분하기 어렵다.

적절한 분담 비율은 과제의 분포에 따라 달라지므로, 들어오는 과제가 달라지면 다시 측정해야 한다. 기밀 업무에 사용할 요금제를 정할 때는 해당 서비스의 데이터 이용 조건을 운영 문서에서 직접 확인해야 한다. 여기서는 특정 요금제를 권하지 않는다. 실행 속도 역시 환경에 따라 달라지므로 한 환경의 측정값을 다른 환경에 그대로 적용할 수 없다.

기준 성능과 비교하고 운영 중에도 평가하기

모든 역할을 성능이 높은 모델에 맡겨 기준 성능을 측정한다. 실제 과제와 비슷한 평가 자료를 모으고 역할별 평가 지표를 정한 뒤, 모델 조합 후보를 기준 성능과 비교한다. 자동 평가와 사람의 판정이 일치하는지도 확인한다. 지출 상한과 사용량 모니터링을 설정하고 운영에 적용하되, 각 단계의 통과 기준을 미리 적어두면 나중에 모델을 바꿀 때도 같은 기준으로 비교할 수 있다.

한 번 측정한 결과만으로 계속 운영해서는 안 된다. 과제의 분포와 모델이 바뀌면 이전 평가가 현재 품질을 설명하지 못할 수 있다. 운영 로그에서 평가 사례를 계속 수집하고 같은 기준으로 모델 조합을 다시 평가한다.

역할별 평가 기준가상의 고객 지원 사례에 사용할 평가 기준이다. 분류·조사·최종 검토를 각각 평가하고, 모든 역할에서 자동 평가와 사람의 판정이 일치하는지도 확인한다. 편집자가 구성한 예시이며 특정 업체의 공식 표가 아니다.근거 S26
역할평가할 내용측정 방법
분류문의 유형을 올바르게 분류했는가정답으로 정한 분류와의 일치율
조사고객의 문제를 해결했는가해결률·정책 인용 정확도
최종 검토답변이 점검표의 조건을 충족하는가점검표 통과율
사람의 판정과 비교자동 평가와 사람의 판정이 일치하는가주기적인 재검토와 판정 일치율
표를 글로 읽기

분류는 정답과의 일치율, 조사는 해결률과 정책 인용 정확도, 최종 검토는 점검표 통과율로 평가한다. 네 번째 행은 자동 평가와 사람의 판정이 일치하는지 확인하는 기준이다.

모델 조합을 바꿀 때 확인할 것

역할마다 모델을 명시하고, 과제에 맞춘 평가로 품질을 확인하며, 사용량을 살펴 비용을 관리한다. 이 중 하나라도 빠지면 모델을 바꾼 뒤 비용과 품질이 어떻게 달라졌는지 판단하기 어렵다.

적절한 분담 비율과 요금제는 각 팀의 과제 분포와 운영 조건에 따라 달라진다. 에이전트의 기본 구조는 「에이전트와 도구 사용」에서, 평가 기준을 세우는 방법은 「AI 평가」에서 더 살펴볼 수 있다.

현재 판 출처 (이 개정의 출처 보관본 아님) 4건

아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.

  1. OpenAI Agents SDK: Models and providers (외부)
    S24
  2. OpenAI Production best practices (외부)
    S25
  3. OpenAI Evaluation best practices (외부)
    S26
  4. Building Effective Agents (외부)
    S9
← 고침 기록으로