본문으로 건너뛰기
마탑6F 도서관
풍경

Eleven v4 출시: 한국어 음성 AI 도입 전에 확인할 것들

감정 표현, 실시간 응답, 목소리 일관성이 달라졌다. 콘텐츠 제작과 고객 응대에 적용하려면 모델 선택부터 한국어 검수, API 연결 방식, 이용 조건까지 함께 살펴봐야 한다.

시드 개정 2판원문 대조 2026-10-06기록 2026-10-06T12:29:12Z

고친 내용: 사례·사용법 보강: BeyondWords와 Descript의 공개 사례, 한국어 첫 음성 실습, 외부 리뷰의 평가 조건과 원문 링크를 추가했다.

Eleven v4 출시: 한국어 음성 AI 도입 전에 확인할 것들

AI 음성을 업무에 붙이면 의외로 작은 부분에서 문제가 드러납니다. 제품명 하나가 어색하게 읽히고, 수정한 문장만 다른 사람처럼 들리고, 고객이 말을 마친 뒤 답변까지의 침묵이 길어집니다. 그래서 새 음성 모델을 평가할 때는 좋은 샘플을 듣는 것만으로 충분하지 않습니다. 우리 서비스에서 반복적으로 생기는 문제를 얼마나 줄일 수 있는지가 중요합니다.

ElevenLabs는 2026년 9월 28일 음성 합성 모델 Eleven v4와 실시간용 Eleven v4 Turbo를 발표했습니다. 회사가 강조하는 변화는 표현력, 화자 일관성, 다국어 음성, 그리고 낮은 지연시간입니다. 두 모델은 ElevenCreative, ElevenAgents, ElevenAPI를 통해 제공됩니다.

TechCrunch도 같은 날 v4 출시를 보도했습니다.

이 글은 2026년 10월 6일 확인한 공식 발표·문서와 매체 보도, 서비스 제공자가 공개한 사례, 외부 리뷰를 구분해 정리했습니다. 직접 음성을 생성하거나 비교 청취·성능 측정을 수행하지 않았으며, 다른 작성자의 시험 결과는 출처와 한계를 함께 밝혔습니다.

이 절의 근거 S41 · S53

콘텐츠를 만들 것인가, 대화를 주고받을 것인가

두 모델은 먼저 용도로 구분하면 이해하기 쉽습니다.

Eleven v4: 내레이션, 오디오북, 캐릭터 대사처럼 완성된 음성의 품질과 연출을 우선하는 작업에 적합한 모델입니다. 모델 ID는 eleven_v4입니다.

Eleven v4 Turbo: 상담형 에이전트와 상호작용하는 음성 서비스처럼 응답 속도가 중요한 작업을 위한 모델입니다. 모델 ID는 eleven_v4_turbo입니다.

공식 모델 목록에 따르면 v4 계열은 한국어를 포함한 90개 이상의 언어를 지원합니다. 일반 v4의 단일 생성 한도는 10,000자로, v3의 5,000자보다 늘었습니다. v3의 공식 언어 범위는 70개 이상입니다.

여기서 중요한 선택 기준은 결과물이 파일인지, 실시간 대화인지입니다. 미리 제작해 검수할 제품 소개 영상과 고객이 기다리는 전화 상담은 같은 방식으로 평가하기 어렵습니다. 전자는 수정과 재생성의 편의성을, 후자는 실제 대화 중 기다림과 끊김을 우선 확인해야 합니다.

이 절의 근거 S42

콘텐츠를 만들 것인가, 대화를 주고받을 것인가두 모델은 먼저 용도로 구분하면 이해하기 쉽습니다.근거 S42 · S41
모델용도모델 ID
Eleven v4내레이션, 오디오북, 캐릭터 대사처럼 완성된 음성의 품질과 연출을 우선하는 작업에 적합한 모델입니다.eleven_v4
Eleven v4 Turbo상담형 에이전트와 상호작용하는 음성 서비스처럼 응답 속도가 중요한 작업을 위한 모델입니다.eleven_v4_turbo
표를 글로 읽기

Eleven v4와 Eleven v4 Turbo의 용도와 모델 ID를 비교한 표.

감정 표현과 목소리 일관성이 함께 바뀌었다

ElevenLabs는 v4에서 대본의 맥락과 연출 지시를 반영하는 능력, 문장을 다시 생성할 때 같은 목소리를 유지하는 능력을 개선했다고 설명합니다. [laughs], [whispers] 같은 태그와 효과음 지시를 대본에 넣을 수 있고, 긴 콘텐츠를 여러 번 나눠 생성할 때 연결의 일관성도 개선 대상에 포함됩니다.

실무적으로는 수정 비용에 영향을 줄 수 있는 변화입니다. 10분짜리 설명 영상에서 가격 안내 한 문장만 바꿀 때, 앞뒤 문장과 자연스럽게 이어진다면 전체를 다시 만드는 일을 줄일 수 있습니다. 다만 실제 절감 효과는 같은 대본의 일부를 반복해서 수정해 보며 확인해야 합니다.

태그를 넣었다고 연출이 항상 정확히 재현되는 것은 아닙니다. 공식 가이드도 태그 반영이 아직 완벽하지 않다고 안내합니다. 또한 v4는 SSML의 break 태그를 지원하지 않으므로, 기존에 사용하던 일시 정지 제어를 그대로 옮기기 전에 확인이 필요합니다.

상담 음성에서는 감정을 많이 넣는 것보다 상황에 맞는 정도로 조절하는 편이 중요합니다. 배송 지연을 안내하면서 지나치게 밝게 말하거나, 단순한 확인에 과장된 감탄을 넣으면 오히려 어색해질 수 있습니다. 이는 기능의 유무보다 대본과 연출 기준을 어떻게 설계하느냐의 문제입니다.

이 절의 근거 S44 · S45

한국어 지원과 우리 서비스의 한국어 품질은 따로 검증해야 한다

한국어가 지원 목록에 있다는 사실만으로 브랜드명, 숫자, 단위, 약어가 모두 원하는 방식으로 읽힌다고 판단하기는 어렵습니다. 발음 가이드 역시 선택한 목소리와 문장에 따라 결과가 달라질 수 있어, 중요한 표현은 직접 시험하도록 권합니다.

검토할 때는 실제 서비스에 가까운 짧은 대본을 준비하는 것이 좋습니다.

숫자와 단위: ‘12,900원’, ‘오후 3시 30분’, ‘2.5kg’을 뜻에 맞게 읽는가

한영 혼용: 제품명, API, SKU가 들어간 문장을 자연스럽게 연결하는가

높임말과 말투: 안내, 사과, 확인 상황에서 어미와 억양이 일관적인가

수정 내구성: 같은 문장을 다시 생성하거나 일부만 교체해도 목소리가 이어지는가

다국어 콘텐츠에서는 억양 변화도 확인해야 합니다. 공식 문서는 참조 음성과 다른 언어를 생성할 경우, 원래 언어의 억양을 옮기기보다 대상 언어의 자연스러운 억양을 지향한다고 설명합니다. 한국어 화자의 목소리로 영어를 만들 때도 이 원칙이 적용됩니다. 기존 억양이 캐릭터의 중요한 특징이었다면 전환 전에 비교가 필요합니다.

이 절의 근거 S45 · S46

Turbo의 150ms를 상담 전체 응답시간으로 읽으면 안 된다

발표에서 제시한 v4 Turbo 수치는 추론 지연 중앙값 약 100ms, 첫 음성이 들리기까지의 시간 중앙값 약 150ms입니다. 특히 150ms는 WebSocket 스트리밍을 사용하고 네트워크 지연을 제거한 회사 측 측정값입니다.

실제 음성 상담에는 사용자의 발화 종료 판단, 음성 인식, 답변 생성, 사내 데이터 조회, 음성 합성, 전송과 재생이 연결됩니다. 따라서 도입 테스트에서는 사용자가 말을 끝낸 순간부터 답변이 들리는 순간까지를 별도로 측정해야 합니다. 평균이나 중앙값뿐 아니라 느린 구간과 예외 상황도 함께 확인하는 편이 좋습니다.

개발자가 바로 확인할 차이도 있습니다. 기존 Text to Speech WebSocket에 모델 ID만 바꿔 넣는 방식으로 v4를 연결할 수는 없습니다. 공식 문서는 v4 계열에 Text to Dialogue WebSocket을 사용하도록 안내합니다. 이 경로에서 일반 v4는 최대 10개 음성을 등록할 수 있지만, v4 Turbo는 연결당 1개 음성만 등록할 수 있습니다.

연결을 유지하는 구현이라면 유휴 처리도 챙겨야 합니다. 공식 실시간 가이드는 클라이언트 메시지가 20초 동안 없으면 연결이 종료되며, keep-alive 메시지로 유지할 수 있다고 설명합니다. 기존 스트리밍 코드를 재사용할 때 이 조건까지 점검하면 좋습니다.

이 절의 근거 S41 · S47 · S48

먼저 시험해 볼 만한 업무

다음은 발표된 기능을 바탕으로 검토할 수 있는 적용 시나리오입니다. 특정 기업에서 효과가 입증됐다는 사례는 아닙니다.

제품 설명과 콘텐츠 현지화

제품 소개, 사용법, 캠페인 영상을 여러 언어로 제작하는 업무입니다. 번역된 대본, 브랜드 용어집, 음성 검수 기준을 함께 관리하면 반복 제작 과정을 정리할 수 있습니다. 첫 실험은 내용과 권리가 명확한 짧은 영상 한 편이 적당합니다.

고객 응대의 제한된 안내 구간

영업시간, 배송 절차, 예약 방법처럼 답변 범위가 명확한 구간부터 검토할 수 있습니다. 답변에 필요한 정보를 찾지 못했을 때의 안내와 사람에게 넘기는 조건을 먼저 설계하고, 음성의 자연스러움과 함께 평가하는 방식이 좋습니다.

교육용 대화와 역할 연습

직원 교육이나 제품 사용 교육에 쓰는 대화형 예시를 만들 수 있습니다. 여러 화자가 등장하는 대본에서는 화자 구분, 전문 용어 발음, 내용의 정확성을 각각 검수해야 합니다. 듣기 좋은 음성만으로 교육 내용의 품질까지 보장되지는 않습니다.

비용과 목소리 사용 권한도 도입 조건이다

2026년 10월 6일 공식 API 가격 페이지에는 1,000자당 v4는 0.08달러, v4 Turbo는 0.04달러가 할인 전 가격으로 표시돼 있습니다. 10월 12일까지의 프로모션 표시는 각각 0.022달러와 0.011달러입니다. 세금은 별도이며, 실제 적용 요금과 플랜 조건은 도입 시 다시 확인해야 합니다.

운영 예산을 잡을 때는 최종 채택한 음성 외에도 재생성과 검수용 생성량을 포함해야 합니다. 실시간 에이전트라면 음성 합성 요금에 더해 사용하는 음성 인식, 답변 모델, 전화 연결 등의 비용도 각 서비스 기준으로 확인해야 합니다. 한시 할인 가격을 장기 운영의 고정 단가로 잡는 것은 피하는 편이 안전합니다.

무료 플랜으로 생성한 콘텐츠에는 상업적 이용 권한이 포함되지 않습니다. 유료 플랜의 상업적 이용도 필요한 권리 보유와 이용약관 준수를 전제로 하며, 베타 서비스에는 별도 제한이 있습니다. 회사 홍보물이나 고객 서비스에 넣기 전 생성 시점의 플랜과 해당 기능의 조건을 확인해야 합니다.

음성 복제에는 추가 확인이 필요합니다. ElevenLabs는 동의나 적법한 권리 없는 음성 복제, 기만적 사칭을 금지합니다.

특히 Professional Voice Clone은 본인 목소리만 생성·검증할 수 있다는 별도 규칙이 있습니다. 다른 사람의 동의를 받았더라도 대신 생성하는 방식은 허용되지 않으며, 당사자가 자신의 계정에서 만들고 검증한 후 공유하는 절차를 안내합니다.

v4의 Professional Voice Clone 지원은 공식 세부 문서에 아직 순차 제공 중으로 표기돼 있습니다. 필요한 계정에서 실제 사용할 수 있는지, 기존 음성에 v4용 학습이 필요한지도 도입 전에 확인해야 합니다.

이 절의 근거 S49 · S50 · S51 · S52 · S46

실제로 공개된 활용 사례: 기사 낭독과 녹음 후 수정

발표된 기능이 어떤 작업에 연결되는지 보려면 실제 제공 서비스의 사례를 함께 읽는 것이 좋습니다. 아래 두 사례는 해당 서비스를 운영하는 회사가 직접 공개한 내용입니다. 기능 제공과 사용 흐름을 확인하는 근거로 삼되, 회사가 표현한 음질 평가는 서비스 제공자의 평가로 구분했습니다.

BeyondWords: 필자의 목소리로 기사를 읽어 주는 오디오 콘텐츠

오디오 퍼블리싱 서비스 BeyondWords는 2026년 10월 6일 v4 제공을 발표했습니다. 작성자 Caroline Piercy는 자신의 v4 복제 음성으로 해당 글을 낭독하고, 가족이 녹음한 원본과 복제 음성을 비교하는 예시도 제시했습니다. 필자나 진행자의 익숙한 목소리를 기사 오디오에 적용하는 방식입니다. BeyondWords의 사례와 원본·복제 음성 비교

기존 BeyondWords 이용자에게 안내한 흐름은 조직 대시보드의 Custom voices에서 + Voice를 선택하고, 승인된 음성 샘플로 음성을 만든 뒤 v4를 골라 Editor에서 시험하는 순서입니다. 이 절차와 포함 기능은 BeyondWords 서비스 기준이므로 ElevenLabs 직접 가입 플랜과 구분해야 합니다. BeyondWords 사용 순서

이 사례를 회사 블로그에 적용한다면, 공개 권리가 있는 글 한 편과 사용 동의가 확보된 음성으로 시작할 수 있습니다. 제목, 소제목, 본문이 음성에서도 잘 구분되는지, 링크나 괄호가 흐름을 끊지 않는지 확인하고 웹페이지의 오디오 안내와 함께 검수하는 방식입니다. ‘익숙한 목소리’라는 방향성은 참고할 수 있지만, 실제 청취 시간이나 전환율 개선은 별도 측정이 필요합니다.

Descript: 녹음이 끝난 뒤 도입 문장만 바꾸기

Descript는 공식 LinkedIn 게시물에서 Eleven v4를 기본 AI 음성 모델로 사용한다고 알렸습니다. 예로 든 작업은 녹음을 마친 뒤 더 나은 도입부가 떠올랐을 때, 새 문장을 입력해 자신의 목소리로 읽게 하는 편집입니다. 억양과 말의 속도감을 유지한다는 설명은 Descript 측 소개이며, 모든 녹음에 대한 품질 보장은 아닙니다. Descript의 녹음 후 도입부 수정 사례

이 사례에서 점검할 부분은 새로 만든 문장과 기존 녹음 사이의 연결입니다. 원래 도입부를 보존하고 대체 문장 하나만 만든 뒤, 앞뒤 문장을 포함해 들어 보세요. 음량, 호흡, 실내 잔향, 말의 속도감이 자연스럽게 이어지는지 확인하면 좋습니다. 제품명이나 가격만 바꾸는 반복 편집에도 같은 검수 기준을 적용할 수 있습니다.

이 절의 근거 S54 · S55

한국어 첫 음성을 만드는 5단계

다음은 공식 Text to Speech 사용 가이드와 v4 프롬프트 문서를 바탕으로 구성한 실습 순서입니다. 예시 대본은 설명을 위해 새로 작성했으며, 이 글에서 음성을 생성하거나 결과를 청취한 것은 아닙니다.

1. 업무 하나와 짧은 대본을 정합니다. 제품 소개, 기능 안내, 교육 도입부 중 하나를 고릅니다. 첫 시도는 30초 안팎을 목표로 짧게 준비하고, 실제 길이는 생성 후 확인합니다. 고객 개인정보와 타인의 무단 녹음은 사용하지 않습니다.

2. Text to Speech에서 목소리와 Eleven v4를 선택합니다. 공식 가이드는 텍스트 입력, 목소리 선택, 설정 조정, 생성의 순서로 안내합니다. 음성 라이브러리의 후보를 고르고, 같은 대본으로 비교할 수 있도록 모델과 음성 이름을 기록합니다. 공식 화면 사용 가이드

3. 태그 없이 기준 음성을 만든 뒤 지시를 하나씩 추가합니다. 처음부터 많은 감정을 섞기보다, 말투가 바뀌어야 하는 부분에만 태그를 넣어 차이를 확인합니다. 공식 가이드는 대괄호 태그와 문장부호로 연출을 조절하도록 안내합니다. 태그 사용법

4. 숫자·브랜드명·수정 연결부를 듣습니다. 예를 들어 ‘12,900원’이 원하는 방식으로 읽히지 않으면 ‘만 이천구백 원’처럼 읽기용 표기를 별도로 시험합니다. 여러 요소를 한꺼번에 바꾸지 말고, 대본·음성·설정 중 무엇을 바꿨는지 기록합니다.

5. 채택한 대본과 음성을 함께 보관합니다. 다운로드한 파일에 사용 모델, 음성, 생성일, 사용 권한을 함께 기록해 두면 이후 수정할 때 비교하기 쉽습니다. 공개 전에는 앞서 설명한 상업적 이용 조건과 목소리 권한을 다시 확인합니다.

가령 기능 소개용 기본 대본은 다음처럼 준비할 수 있습니다.

“안녕하세요. 오늘은 주문 내역을 정리하는 방법을 안내합니다. 먼저 파일을 올리고, 날짜와 금액을 확인한 뒤, 결과를 내려받으세요.”

연출 차이를 확인하는 별도 시험에서는 마지막에 “[whispers] 마지막으로, 저장된 파일도 한 번 확인해 보세요.”를 붙여 볼 수 있습니다. 이 예시는 태그가 반영되는지 확인하기 위한 것이며, 실제 업무용 안내에 속삭임이 적합하다는 뜻은 아닙니다. 태그를 뺀 버전과 함께 들어 보고 용도에 맞는 쪽을 선택하면 됩니다.

영상 자료로는 ElevenLabs 공식 YouTube 소개 영상을 함께 참고할 수 있습니다. 소개 영상을 본 뒤 자신의 대본으로 결과를 확인하면, 인상적인 데모와 실제 작업의 차이를 판단하기 좋습니다.

이 절의 근거 S56 · S45 · S57

외부 리뷰는 테스트 설계의 참고 자료로 읽기

Quantslant는 2026년 9월 30일 영어 숫자·날짜·약어를 시험한 리뷰를 공개했습니다. 자체 평가에서 v4와 v4 Turbo가 18개 항목을 통과했다고 보고했고, 같은 항목에서 v3도 동일한 점수를 기록했습니다. 음성·대본·전사 도구를 밝힌 점은 참고할 만하지만, 작은 영어 표본이며 제휴 링크를 포함한 매체의 자체 시험입니다. 한국어 정확도나 보편적인 우열을 입증하는 결과로 확대하면 안 됩니다. Quantslant의 영어 테스트와 조건

실무에서 가져올 부분은 평가 방식을 구체화하는 습관입니다. ‘자연스럽다’는 한 가지 점수에 모든 것을 합치기보다 숫자 읽기, 고유명사, 태그 반영, 문장 누락, 첫 음성까지의 시간을 따로 기록해 보세요. 같은 대본을 여러 목소리와 반복 생성으로 비교하면, 좋은 결과가 특정 조합에서만 나오는지도 확인할 수 있습니다. 한국어에서는 원문을 보며 사람이 듣는 검수를 함께 두는 편이 좋습니다.

이 절의 근거 S58

도입 판단은 작은 비교 실험에서 시작하면 된다

Eleven v4를 검토하는 팀이라면 먼저 한 가지 업무를 고르고, 20~30개의 짧은 한국어 대본으로 기존 방식과 비교해 볼 수 있습니다. 자연스러움, 발음 오류, 목소리 일관성, 재생성 횟수, 최종 채택까지의 시간을 기록하면 판단이 구체적이 됩니다. 실시간 서비스라면 여기에 전체 응답시간과 사람 연결 성공 여부를 더하면 됩니다.

이번 출시에서 주목할 부분은 표현력과 실시간성이 함께 개선 대상으로 제시됐다는 점입니다. 그 변화가 우리 업무에서도 의미가 있는지는 한국어 검수와 실제 운영 흐름 속에서 확인해야 합니다. 작은 범위에서 시작해 결과를 기록하는 것이 다음 도입 결정을 위한 가장 확실한 출발점입니다.

현재 판 출처 (이 개정의 출처 보관본 아님) 17건

아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.

  1. 공식 출시 발표 (외부)
    S41
  2. 모델별 사양과 지원 언어 (외부)
    S42
  3. v4 제품 소개 (외부)
    S44
  4. 프롬프트와 발음 제어 가이드 (외부)
    S45
  5. v4의 언어 간 억양 처리 (외부)
    S46
  6. WebSocket 방식 비교 (외부)
    S47
  7. 실시간 대화 스트리밍 가이드 (외부)
    S48
  8. API 가격표 (외부)
    S49
  9. 생성 콘텐츠의 공개·상업적 이용 안내 (외부)
    S50
  10. 금지 사용 정책 (외부)
    S51
  11. Professional Voice Clone 생성 규칙 (외부)
    S52
  12. Eleven v4 출시 보도 (외부)
    S53
  13. Eleven v4: Voice cloning this fast should not sound this good (외부)
    S54
  14. Descript의 Eleven v4 기반 도입부 수정 사례 (외부)
    S55
  15. Text to Speech 공식 사용 가이드 (외부)
    S56
  16. Introducing Eleven v4 and Eleven v4 Turbo (외부)
    S57
  17. Eleven v4 Review: Numbers, Dates & Emotion Tags in English (외부)
    S58
← 고침 기록으로