Eleven v4 출시: 한국어 음성 AI 도입 전에 확인할 것들
감정 표현, 실시간 응답, 목소리 일관성이 달라졌다. 콘텐츠 제작과 고객 응대에 적용하려면 모델 선택부터 한국어 검수, API 연결 방식, 이용 조건까지 함께 살펴봐야 한다.
고친 내용: 초판: 공식 발표와 제품 문서를 바탕으로 Eleven v4의 한국어 음성 도입 조건을 정리했다.
Eleven v4 출시: 한국어 음성 AI 도입 전에 확인할 것들
AI 음성을 업무에 붙이면 의외로 작은 부분에서 문제가 드러납니다. 제품명 하나가 어색하게 읽히고, 수정한 문장만 다른 사람처럼 들리고, 고객이 말을 마친 뒤 답변까지의 침묵이 길어집니다. 그래서 새 음성 모델을 평가할 때는 좋은 샘플을 듣는 것만으로 충분하지 않습니다. 우리 서비스에서 반복적으로 생기는 문제를 얼마나 줄일 수 있는지가 중요합니다.
ElevenLabs는 2026년 9월 28일 음성 합성 모델 Eleven v4와 실시간용 Eleven v4 Turbo를 발표했습니다. 회사가 강조하는 변화는 표현력, 화자 일관성, 다국어 음성, 그리고 낮은 지연시간입니다. 두 모델은 ElevenCreative, ElevenAgents, ElevenAPI를 통해 제공됩니다.
이 글은 2026년 10월 6일 확인한 공식 발표와 문서를 바탕으로 기능과 도입 시 점검할 사항을 정리했습니다. 직접 생성한 음성의 비교 청취나 독립 성능 측정 결과는 포함하지 않습니다.
이 절의 근거 S41
콘텐츠를 만들 것인가, 대화를 주고받을 것인가
두 모델은 먼저 용도로 구분하면 이해하기 쉽습니다.
Eleven v4: 내레이션, 오디오북, 캐릭터 대사처럼 완성된 음성의 품질과 연출을 우선하는 작업에 적합한 모델입니다. 모델 ID는 eleven_v4입니다.
Eleven v4 Turbo: 상담형 에이전트와 상호작용하는 음성 서비스처럼 응답 속도가 중요한 작업을 위한 모델입니다. 모델 ID는 eleven_v4_turbo입니다.
공식 모델 목록에 따르면 v4 계열은 한국어를 포함한 90개 이상의 언어를 지원합니다. 일반 v4의 단일 생성 한도는 10,000자로, v3의 5,000자보다 늘었습니다. v3의 공식 언어 범위는 70개 이상입니다.
여기서 중요한 선택 기준은 결과물이 파일인지, 실시간 대화인지입니다. 미리 제작해 검수할 제품 소개 영상과 고객이 기다리는 전화 상담은 같은 방식으로 평가하기 어렵습니다. 전자는 수정과 재생성의 편의성을, 후자는 실제 대화 중 기다림과 끊김을 우선 확인해야 합니다.
이 절의 근거 S42
| 모델 | 용도 | 모델 ID |
|---|---|---|
| Eleven v4 | 내레이션, 오디오북, 캐릭터 대사처럼 완성된 음성의 품질과 연출을 우선하는 작업에 적합한 모델입니다. | eleven_v4 |
| Eleven v4 Turbo | 상담형 에이전트와 상호작용하는 음성 서비스처럼 응답 속도가 중요한 작업을 위한 모델입니다. | eleven_v4_turbo |
표를 글로 읽기
Eleven v4와 Eleven v4 Turbo의 용도와 모델 ID를 비교한 표.
감정 표현과 목소리 일관성이 함께 바뀌었다
ElevenLabs는 v4에서 대본의 맥락과 연출 지시를 반영하는 능력, 문장을 다시 생성할 때 같은 목소리를 유지하는 능력을 개선했다고 설명합니다. [laughs], [whispers] 같은 태그와 효과음 지시를 대본에 넣을 수 있고, 긴 콘텐츠를 여러 번 나눠 생성할 때 연결의 일관성도 개선 대상에 포함됩니다.
실무적으로는 수정 비용에 영향을 줄 수 있는 변화입니다. 10분짜리 설명 영상에서 가격 안내 한 문장만 바꿀 때, 앞뒤 문장과 자연스럽게 이어진다면 전체를 다시 만드는 일을 줄일 수 있습니다. 다만 실제 절감 효과는 같은 대본의 일부를 반복해서 수정해 보며 확인해야 합니다.
태그를 넣었다고 연출이 항상 정확히 재현되는 것은 아닙니다. 공식 가이드도 태그 반영이 아직 완벽하지 않다고 안내합니다. 또한 v4는 SSML의 break 태그를 지원하지 않으므로, 기존에 사용하던 일시 정지 제어를 그대로 옮기기 전에 확인이 필요합니다.
상담 음성에서는 감정을 많이 넣는 것보다 상황에 맞는 정도로 조절하는 편이 중요합니다. 배송 지연을 안내하면서 지나치게 밝게 말하거나, 단순한 확인에 과장된 감탄을 넣으면 오히려 어색해질 수 있습니다. 이는 기능의 유무보다 대본과 연출 기준을 어떻게 설계하느냐의 문제입니다.
한국어 지원과 우리 서비스의 한국어 품질은 따로 검증해야 한다
한국어가 지원 목록에 있다는 사실만으로 브랜드명, 숫자, 단위, 약어가 모두 원하는 방식으로 읽힌다고 판단하기는 어렵습니다. 발음 가이드 역시 선택한 목소리와 문장에 따라 결과가 달라질 수 있어, 중요한 표현은 직접 시험하도록 권합니다.
검토할 때는 실제 서비스에 가까운 짧은 대본을 준비하는 것이 좋습니다.
숫자와 단위: ‘12,900원’, ‘오후 3시 30분’, ‘2.5kg’을 뜻에 맞게 읽는가
한영 혼용: 제품명, API, SKU가 들어간 문장을 자연스럽게 연결하는가
높임말과 말투: 안내, 사과, 확인 상황에서 어미와 억양이 일관적인가
수정 내구성: 같은 문장을 다시 생성하거나 일부만 교체해도 목소리가 이어지는가
다국어 콘텐츠에서는 억양 변화도 확인해야 합니다. 공식 문서는 참조 음성과 다른 언어를 생성할 경우, 원래 언어의 억양을 옮기기보다 대상 언어의 자연스러운 억양을 지향한다고 설명합니다. 한국어 화자의 목소리로 영어를 만들 때도 이 원칙이 적용됩니다. 기존 억양이 캐릭터의 중요한 특징이었다면 전환 전에 비교가 필요합니다.
Turbo의 150ms를 상담 전체 응답시간으로 읽으면 안 된다
발표에서 제시한 v4 Turbo 수치는 추론 지연 중앙값 약 100ms, 첫 음성이 들리기까지의 시간 중앙값 약 150ms입니다. 특히 150ms는 WebSocket 스트리밍을 사용하고 네트워크 지연을 제거한 회사 측 측정값입니다.
실제 음성 상담에는 사용자의 발화 종료 판단, 음성 인식, 답변 생성, 사내 데이터 조회, 음성 합성, 전송과 재생이 연결됩니다. 따라서 도입 테스트에서는 사용자가 말을 끝낸 순간부터 답변이 들리는 순간까지를 별도로 측정해야 합니다. 평균이나 중앙값뿐 아니라 느린 구간과 예외 상황도 함께 확인하는 편이 좋습니다.
개발자가 바로 확인할 차이도 있습니다. 기존 Text to Speech WebSocket에 모델 ID만 바꿔 넣는 방식으로 v4를 연결할 수는 없습니다. 공식 문서는 v4 계열에 Text to Dialogue WebSocket을 사용하도록 안내합니다. 이 경로에서 일반 v4는 최대 10개 음성을 등록할 수 있지만, v4 Turbo는 연결당 1개 음성만 등록할 수 있습니다.
연결을 유지하는 구현이라면 유휴 처리도 챙겨야 합니다. 공식 실시간 가이드는 클라이언트 메시지가 20초 동안 없으면 연결이 종료되며, keep-alive 메시지로 유지할 수 있다고 설명합니다. 기존 스트리밍 코드를 재사용할 때 이 조건까지 점검하면 좋습니다.
먼저 시험해 볼 만한 업무
다음은 발표된 기능을 바탕으로 검토할 수 있는 적용 시나리오입니다. 특정 기업에서 효과가 입증됐다는 사례는 아닙니다.
제품 설명과 콘텐츠 현지화
제품 소개, 사용법, 캠페인 영상을 여러 언어로 제작하는 업무입니다. 번역된 대본, 브랜드 용어집, 음성 검수 기준을 함께 관리하면 반복 제작 과정을 정리할 수 있습니다. 첫 실험은 내용과 권리가 명확한 짧은 영상 한 편이 적당합니다.
고객 응대의 제한된 안내 구간
영업시간, 배송 절차, 예약 방법처럼 답변 범위가 명확한 구간부터 검토할 수 있습니다. 답변에 필요한 정보를 찾지 못했을 때의 안내와 사람에게 넘기는 조건을 먼저 설계하고, 음성의 자연스러움과 함께 평가하는 방식이 좋습니다.
교육용 대화와 역할 연습
직원 교육이나 제품 사용 교육에 쓰는 대화형 예시를 만들 수 있습니다. 여러 화자가 등장하는 대본에서는 화자 구분, 전문 용어 발음, 내용의 정확성을 각각 검수해야 합니다. 듣기 좋은 음성만으로 교육 내용의 품질까지 보장되지는 않습니다.
비용과 목소리 사용 권한도 도입 조건이다
2026년 10월 6일 공식 API 가격 페이지에는 1,000자당 v4는 0.08달러, v4 Turbo는 0.04달러가 할인 전 가격으로 표시돼 있습니다. 10월 12일까지의 프로모션 표시는 각각 0.022달러와 0.011달러입니다. 세금은 별도이며, 실제 적용 요금과 플랜 조건은 도입 시 다시 확인해야 합니다.
운영 예산을 잡을 때는 최종 채택한 음성 외에도 재생성과 검수용 생성량을 포함해야 합니다. 실시간 에이전트라면 음성 합성 요금에 더해 사용하는 음성 인식, 답변 모델, 전화 연결 등의 비용도 각 서비스 기준으로 확인해야 합니다. 한시 할인 가격을 장기 운영의 고정 단가로 잡는 것은 피하는 편이 안전합니다.
무료 플랜으로 생성한 콘텐츠에는 상업적 이용 권한이 포함되지 않습니다. 유료 플랜의 상업적 이용도 필요한 권리 보유와 이용약관 준수를 전제로 하며, 베타 서비스에는 별도 제한이 있습니다. 회사 홍보물이나 고객 서비스에 넣기 전 생성 시점의 플랜과 해당 기능의 조건을 확인해야 합니다.
음성 복제에는 추가 확인이 필요합니다. ElevenLabs는 동의나 적법한 권리 없는 음성 복제, 기만적 사칭을 금지합니다.
특히 Professional Voice Clone은 본인 목소리만 생성·검증할 수 있다는 별도 규칙이 있습니다. 다른 사람의 동의를 받았더라도 대신 생성하는 방식은 허용되지 않으며, 당사자가 자신의 계정에서 만들고 검증한 후 공유하는 절차를 안내합니다.
v4의 Professional Voice Clone 지원은 공식 세부 문서에 아직 순차 제공 중으로 표기돼 있습니다. 필요한 계정에서 실제 사용할 수 있는지, 기존 음성에 v4용 학습이 필요한지도 도입 전에 확인해야 합니다.
이 절의 근거 S49 · S50 · S51 · S52 · S46
도입 판단은 작은 비교 실험에서 시작하면 된다
Eleven v4를 검토하는 팀이라면 먼저 한 가지 업무를 고르고, 20~30개의 짧은 한국어 대본으로 기존 방식과 비교해 볼 수 있습니다. 자연스러움, 발음 오류, 목소리 일관성, 재생성 횟수, 최종 채택까지의 시간을 기록하면 판단이 구체적이 됩니다. 실시간 서비스라면 여기에 전체 응답시간과 사람 연결 성공 여부를 더하면 됩니다.
이번 출시에서 주목할 부분은 표현력과 실시간성이 함께 개선 대상으로 제시됐다는 점입니다. 그 변화가 우리 업무에서도 의미가 있는지는 한국어 검수와 실제 운영 흐름 속에서 확인해야 합니다. 작은 범위에서 시작해 결과를 기록하는 것이 다음 도입 결정을 위한 가장 확실한 출발점입니다.
현재 판 출처 (이 개정의 출처 보관본 아님) 17건
아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.
- 공식 출시 발표 (외부)
S41 - 모델별 사양과 지원 언어 (외부)
S42 - v4 제품 소개 (외부)
S44 - 프롬프트와 발음 제어 가이드 (외부)
S45 - v4의 언어 간 억양 처리 (외부)
S46 - WebSocket 방식 비교 (외부)
S47 - 실시간 대화 스트리밍 가이드 (외부)
S48 - API 가격표 (외부)
S49 - 생성 콘텐츠의 공개·상업적 이용 안내 (외부)
S50 - 금지 사용 정책 (외부)
S51 - Professional Voice Clone 생성 규칙 (외부)
S52 - Eleven v4 출시 보도 (외부)
S53 - Eleven v4: Voice cloning this fast should not sound this good (외부)
S54 - Descript의 Eleven v4 기반 도입부 수정 사례 (외부)
S55 - Text to Speech 공식 사용 가이드 (외부)
S56 - Introducing Eleven v4 and Eleven v4 Turbo (외부)
S57 - Eleven v4 Review: Numbers, Dates & Emotion Tags in English (외부)
S58