Mistral Large 4 프리뷰의 가격과 성능을 확인하는 방법
Mistral Large 4가 API 프리뷰로 공개됐다. 할인 가격과 가중치 공개 계획, 서로 다른 공식 사양, 독립 평가와 실제 개발자 실험을 구별해 살펴본다.
고친 내용: Large 4 프리뷰의 공식 사양 불일치와 할인·기존 요금, 산술 비용 예제, 독립 평가와 개발자 실험의 한계 및 한국어 평가 설계를 출처 및 비교표와 함께 정리했습니다.
Mistral Large 4 프리뷰의 가격과 성능을 확인하는 방법
Mistral이 2026년 10월 6일 새 대형 모델 Mistral Large 4, 별칭 Le Chonk의 공개 프리뷰를 발표했습니다. 지금 평가할 수 있는 것은 API 프리뷰입니다. 가중치는 월말까지 공개하겠다는 계획이며 발표만 보고 이미 다운로드하거나 자체 서버에 배포할 수 있다고 생각하면 안 됩니다. 공식 발표
관심을 가질 이유는 충분합니다. Mistral은 코딩, 업무용 에이전트, 이미지와 문서 이해를 주요 활용 분야로 제시합니다. 다만 모델의 크기와 발표 벤치마크만으로 실제 도입 여부를 결정하기는 어렵습니다. 출시 초기에는 사양과 가격 표기부터 서로 다른 부분이 있어 어느 자료의 어떤 수치인지 확인하는 과정이 필요합니다.
이 글은 공개 자료, 독립 평가기관의 측정, 개발자의 소규모 실험을 구분해 정리합니다. TheMagicTower가 유료 API를 실행한 벤치마크나 한국어 품질 실측 결과는 아닙니다.
이 절의 근거 S74
지금 사용할 수 있는 범위
Mistral 모델 문서는 Large 4를 공개 프리뷰로 표시하고 구조화된 출력, 함수 호출, 문서 질의와 에이전트용 인터페이스 등을 안내합니다. 공식 발표는 Mistral Studio의 프리뷰 API를 이용 경로로 제시합니다.
실무에서는 다음 세 시점을 구별해 두는 것이 좋습니다.
발표일: 새 모델과 성능 자료를 공개한 날
API 프리뷰: 호스팅된 모델을 호출해 시험할 수 있는 단계
가중치 공개: 모델 파일과 이용 조건을 확인하고 자체 실행을 검토할 수 있는 단계
현재 세 번째 단계는 예정입니다. 가중치가 공개된 뒤에도 상업적 사용 조건, 배포 환경, 운영 비용을 별도로 확인해야 합니다. 프리뷰 API를 평가하는 일과 자체 호스팅을 결정하는 일은 요구되는 검토 자료가 다릅니다.
이 절의 근거 S75
그림을 글로 읽기
API 프리뷰 → 공식 사양·요금 확인 → 업무 표본 평가 → 도입 판단 순서로 독자가 확인할 항목을 연결한 편집부 제안 흐름도입니다.
공식 자료 안에서도 달랐던 사양
10월 7일 확인한 자료를 비교하면 다음 차이가 있습니다.
전체 파라미터의 표현은 반올림 차이일 수 있지만 활성 파라미터가 다른 이유는 확인된 자료만으로 설명할 수 없습니다. 따라서 어느 한쪽을 확정치로 골라 경쟁 모델과 정밀 비교하지 않는 편이 맞습니다. 위 표는 오류를 임의로 수정한 값이 아니라 각 문서의 표기를 함께 보여 준 것입니다. 출시 글 · 모델 문서
컨텍스트도 주의할 부분입니다. 공식 모델 문서는 100만 토큰을 표시하지만 Artificial Analysis의 프리뷰 페이지는 약 52만 토큰를 표시합니다. 문서나 평가에 사용한 조건이 다를 수 있으므로 긴 입력이 중요한 서비스라면 사용할 API 경로의 실제 지원 범위를 별도로 확인해야 합니다. 이 차이의 원인이 확정됐다고 주장하지는 않습니다.
| 항목 | 공식 출시 글 | 공식 모델 문서 |
|---|---|---|
| 전체 파라미터 | 약 1조 | 1.05조 |
| 활성 파라미터 | 490억 | 520억 |
| 가중치 상태 | 월말 공개 예정 | 공개 프리뷰로 표시 |
표를 글로 읽기
공식 자료의 사양 차이. 항목, 공식 출시 글, 공식 모델 문서 항목을 원고의 모든 행과 함께 읽을 수 있는 표입니다.
현재 가격과 정상가를 함께 보기
공식 API 가격표는 Large 4에 할인 가격을 표시하고 있습니다. 아래는 2026년 10월 7일 확인 기준이며 모두 미국 달러·100만 토큰당 금액입니다.
공식 출시 글에는 입력 $1.36, 출력 $4.18이 남아 있습니다. 할인 종료 시점은 확인한 가격표에서 찾지 못했습니다. 따라서 장기 예산을 할인 가격 하나로만 계산하기보다는 기존 가격으로 돌아가는 경우도 함께 계산하는 편이 좋습니다.
예를 들어 캐시를 사용하지 않고 과금 대상 입력이 10만 토큰·출력이 1만 토큰인 요청을 가정하면 다음과 같습니다.
할인 가격 기준: $0.068 + $0.0209 = $0.0889
표시된 기존 가격 기준: $0.136 + $0.0418 = $0.1778
이는 가격표를 적용한 단순 산술 예제입니다. 실제 호출 결과나 청구액이 아니며 토큰 수가 달라지거나 재시도·다른 서비스 비용이 생기면 총비용도 달라집니다. 에이전트는 하나의 일을 끝내기까지 모델을 여러 번 호출할 수 있으므로 요청 한 번의 비용과 업무 한 건의 비용도 따로 봐야 합니다.
이 절의 근거 S76
| 과금 항목 | 표시된 할인 가격 | 함께 표시된 기존 가격 |
|---|---|---|
| 입력 | $0.68 | $1.36 |
| 캐시된 입력 | $0.07 | $0.14 |
| 출력 | $2.09 | $4.18 |
표를 글로 읽기
할인 가격과 함께 표시된 기존 가격. 과금 항목, 표시된 할인 가격, 함께 표시된 기존 가격 항목을 원고의 모든 행과 함께 읽을 수 있는 표입니다.

발표 데모와 독립 평가가 말해 주는 것
Mistral의 발표 페이지에는 재무 자료 조사와 시각 자료 분석 등 다양한 데모가 있습니다. 해당 자료는 제조사가 선정해 공개한 예시입니다. 우리 업무와 비슷한 문제가 있는지 살펴보는 데 유용하지만 보이지 않는 실패 사례의 빈도나 한국어 문서의 평균 정확도까지 알려 주지는 않습니다.
벤치마크를 확인할 때도 측정 주체를 구별해야 합니다. Mistral이 강조하는 특정 산업별 우위와, 독립 평가기관이 같은 모델을 비교한 종합 결과는 서로 다른 질문에 답합니다. Artificial Analysis의 Large 4 프리뷰 평가는 확인 시점에 Intelligence Index 38을 표시합니다. 이 값은 해당 평가 체계의 점수이며 일반 업무를 38% 성공한다는 뜻은 아닙니다.
같은 페이지의 가격과 컨텍스트가 현재 공식 문서와 다르다는 점도 중요합니다. 벤치마크 페이지의 비용을 그대로 복사해 오늘의 API 청구액으로 제시하기보다 성능 측정 조건과 현재 요금표를 각각 확인해야 합니다.
이 절의 근거 S77
실제 개발자 실험은 어떻게 읽을까
개발자 Simon Willison은 10월 6일 Large 4를 API로 시험한 글을 공개했습니다. 자전거를 타는 펠리컨을 SVG로 그리게 하는 작은 실험에서 추론 설정을 바꾸고 결과와 출력 토큰 수를 비교했습니다. 그는 해당 예시에서 high 설정의 그림을 더 좋게 평가했으며 출력 토큰 수는 none의 3,275개보다 high의 2,717개가 적었다고 기록했습니다.
이는 실행 결과를 공개한 개인 실험이라는 점에서 제품 소개와 성격이 다릅니다. 그렇다고 그림 한 장의 결과를 모든 코딩 업무의 순위로 확대할 수는 없습니다. 여기서 실무자가 가져갈 부분은 같은 입력으로 설정을 바꾸고 결과와 비용을 함께 기록하는 방식입니다. 추론 강도를 높이면 언제나 더 많은 토큰을 쓰거나 언제나 더 좋은 답이 나온다고 단정할 필요도 없습니다.
Willison은 같은 날 llm-mistral 0.16에서 Large 4 같은 추론 모델 지원을 추가했습니다. 개발 도구 측면의 구체적인 후속 자료로 참고할 수 있습니다. 이 글에서는 해당 플러그인을 설치하거나 API를 실행하지 않았습니다.
한국어 업무에 맞는 작은 평가 세트 만들기
벤치마크가 모델을 후보군에 넣는 근거라면 실제 선택은 자신의 업무 표본으로 확인하는 편이 좋습니다. 아래는 이 글이 제안하는 평가 설계입니다. 아직 측정한 결과는 없습니다.
- 문서 질문과 근거 확인
답이 있는 질문과 없는 질문을 섞고 근거 문장이 실제로 존재하는지 확인합니다.
- 구조화된 정보 추출
가상 입력으로 제품명·수량·날짜를 추출하며 없는 값은 null로 남깁니다.
- 작은 코드 수정
통제된 환경에서 수정 범위와 기존 테스트를 확인합니다.
- 이미지와 도표 읽기
축·단위·범례·각주를 읽는 질문을 만들고 답의 숫자를 원본과 대조합니다.
단계를 글로 읽기
문서 질문과 근거 확인, 구조화된 정보 추출, 작은 코드 수정, 이미지와 도표 읽기 단계와 각 단계에서 확인할 내용을 정리한 미실행 편집부 제안입니다.
문서 질문과 근거 확인
공개 가능한 한국어 운영 문서 몇 개를 준비합니다. 문서에 답이 있는 질문, 여러 문서를 함께 읽어야 하는 질문, 문서에 답이 없는 질문을 섞습니다.
첨부한 문서만 근거로 답해 줘. 사용한 문서 이름과 해당 문장을 짧게 제시해 줘. 문서에 답이 없으면 확인할 수 없다고 말해 줘. 날짜나 조건이 충돌하면 한쪽을 임의로 선택하지 말고 차이를 보여 줘.
채점할 때는 정답뿐 아니라 근거가 실제 문서에 존재하는지 확인합니다. 답이 없는 질문에 솔직히 멈추는지도 평가 항목에 넣습니다.
구조화된 정보 추출
가상의 상품 문의나 주문 안내 문장에서 제품명·수량·날짜를 JSON으로 추출하도록 요청합니다. 없는 값은 null로 남기고 이름이 비슷한 상품을 잘못 합치지 않는지 봅니다. 실제 고객 정보 대신 가상 입력을 쓰면 초기 평가에서 불필요한 개인정보 전송을 줄일 수 있습니다.
작은 코드 수정
비밀정보가 없는 작은 함수와 테스트를 준비합니다. 모델에는 버그 수정 범위와 기존 테스트 유지 조건을 줍니다. 설명이 그럴듯한지보다 테스트가 통과하는지, 관계없는 파일을 바꾸지 않았는지 확인합니다. 코드 실행과 저장소 변경은 반드시 통제된 환경에서 검토합니다.
이미지와 도표 읽기
텍스트만으로 평가를 끝내지 않고 공개 가능한 표나 도표를 하나 넣어 봅니다. 축의 단위, 범례, 각주에 따라 답이 달라지는 질문을 만들면 이미지 이해가 업무에 도움이 되는지 살펴볼 수 있습니다. 모델이 제시한 숫자는 원본 이미지와 대조합니다.
비교할 때 함께 남길 기록
처음부터 많은 모델을 비교할 필요는 없습니다. 현재 사용 중인 모델과 Large 4를 같은 표본으로 비교하고 개선이 필요한 업무에서 실제 차이가 있는지 보는 것으로 시작할 수 있습니다. 통과 기준과 예산 한도는 실행 전에 정해 두는 것이 좋습니다.
| 기록 항목 | 남겨야 하는 이유 |
|---|---|
| 모델 식별자와 실행 날짜 | 프리뷰 변경 전후를 구별하기 위해 |
| 입력 자료와 프롬프트 | 같은 조건으로 다시 비교하기 위해 |
| 추론 설정과 도구 사용 범위 | 모델 외 조건의 영향을 구별하기 위해 |
| 과금된 입력·출력·캐시 토큰 | 총비용을 계산하기 위해 |
| 완료까지의 시간과 재시도 횟수 | 실제 업무 처리 시간을 보기 위해 |
| 정답·형식·근거·금지 행동 결과 | 하나의 종합 점수에 가려진 오류를 찾기 위해 |
| 사람이 수정한 내용 | 검수 부담까지 도입 판단에 반영하기 위해 |
표를 글로 읽기
평가 비교 기록 항목. 기록 항목, 남겨야 하는 이유 항목을 원고의 모든 행과 함께 읽을 수 있는 표입니다.
도입 전에 남은 질문
현재 확실하게 말할 수 있는 것은 새 프리뷰를 평가할 경로가 열렸다는 점입니다. 가중치 공개 여부와 라이선스, 최종 사양, 할인 종료 조건은 계속 확인할 항목입니다. 한국어 문서와 실제 업무에서 보이는 성능도 별도 평가가 필요합니다.
Large 4가 관심 있는 업무에서 검수 시간을 줄이고 비용과 지연시간이 예산에 맞는다면 도입 후보가 될 수 있습니다. 출시 당일의 가장 높은 막대그래프보다 중요한 것은 같은 업무를 어떤 조건에서 얼마나 안정적으로 끝내는지를 자신의 기록으로 확인하는 일입니다.
정보 확인일: 2026년 10월 7일. 가격은 미국 달러 기준이며 프리뷰 사양과 이용 조건은 변경될 수 있습니다.
현재 판 출처 (이 개정의 출처 보관본 아님) 6건
아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.