한국어 음성을 만드는 제작자와 개발자는 제미나이 3.8 TTS의 새 목소리 기능과 함께 대본 지시를 얼마나 잘 따르는지와 다시 만드는 비용을 비교하면 모델을 고르기 수월합니다. Google은 2026년 9월 23일, 글로 적은 대본을 음성으로 바꾸는 Gemini 3.8 Flash TTS와 Flash-Lite TTS를 발표했습니다. Flash는 목소리와 연기를 섬세하게 만드는 쪽, Lite는 많은 음성을 효율적으로 만드는 쪽에 초점을 맞췄습니다. (공식 발표)
외부 평가에서는 긴 음성의 안정성이 좋아졌지만, 특정 나이의 목소리나 음량을 정확히 지정하는 데는 약점도 드러났습니다. Hacker News에서는 제품별 제공 범위 차이에 대한 불만과 음성 복제의 쓰임을 둘러싼 토론이 함께 나왔습니다. 아래 한국어 샘플은 9월 27일 만든 결과를 유지했으며, 평가·이용 조건의 확인일은 9월 30일입니다. (Hume 평가 · 출시 토론)
한눈에 보기
| 궁금한 점 | 이번 발표의 핵심 |
|---|---|
| 어떤 모델인가요? | 대본을 음성으로 만드는 두 모델입니다. Flash는 창작·연기, Lite는 처리량·지연·비용에 초점을 맞춥니다. |
| 새 기능은 무엇인가요? | 자연어 목소리 설계, 30초 샘플 기반 복제, 2,000개 이상의 음성 라이브러리와 대사별 연기 지시를 제공합니다. |
| 한국어도 지원하나요? | 두 모델 모두 한국어를 지원하며, 언어 수는 Flash 130개, Lite 101개입니다. |
| 성능은 어떤가요? | Hume에서 장문 안정성이 향상됐습니다. Artificial Analysis의 선호 순위는 Flash 3위, Lite 7위입니다. |
| 비용은 얼마인가요? | Standard 출력 단가는 올해 말까지 Flash $9, Lite $6/100만 오디오 토큰으로 안내됐습니다. 출력 1시간 계산은 약 $0.81/$0.54입니다. |
| 기본 설정은 어떤가요? | 두 모델은 같은 API 구조를 쓰며, 추론 강도 조절을 지원하지 않습니다. 기본 오디오 파일은 WAV입니다. |
| 무엇을 바꾸나요? | 연기 지시·화자 이름을 speech_metadata로 옮기고, 기존 PCM→WAV 래퍼를 점검합니다. |
| 어디서 쓰나요? | 두 모델 모두 API·AI Studio, Flash는 Gemini Notebook, Lite는 Google Vids에 들어갑니다. Enterprise API는 발표 당시 제공 예정입니다. |
기능·이용 조건은 Google 발표와 개발자 문서를, 성능 수치는 Hume·Artificial Analysis의 외부 평가를 따릅니다. Google이 내세우는 연기·지역 억양 개선과 외부 비교 점수는 구분해 읽었습니다. 한국어 샘플의 길이·시간·토큰 수는 이 블로그에서 한 번씩 만든 기록이며, 시간당 비용은 출력 단가를 곱한 계산입니다. (Flash 문서 · Lite 문서 · 순위표)
Flash와 Lite는 어떤 작업에 맞을까요?
TTS는 Text-to-Speech, 즉 글을 음성으로 바꾸는 기능입니다. 읽을 문장을 정해 두는 뉴스 낭독·게임 대사·오디오북에 잘 맞습니다. 사용자의 말을 듣고 답을 생각하는 Live API와 달리, 두 모델은 텍스트를 입력받아 오디오를 출력하는 데 집중합니다. 음성 상담을 만든다면 답변을 만드는 모델과 그 답변을 읽는 TTS를 나눠 생각하면 이해하기 쉽습니다. (음성 생성 안내)
| 비교할 항목 | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
| 중점 | 음성 충실도, 연기의 뉘앙스, 지역 억양 | 높은 처리량, 낮은 지연, 비용 효율 |
| 문서가 제시하는 작업 | 오디오북, 스튜디오 낭독, 복잡한 다중 화자 대화, 어려운 발음·방언 | 대량 제작, 읽어 주기, 음성 에이전트의 발화 단계, 일상적 단일 화자 생성 |
| 지원 언어 | 130개 | 101개 |
| 모델 ID | gemini-3.8-flash-tts |
gemini-3.8-flash-lite-tts |
| 이전 모델과의 관계 | 새 창작 중심 상위 선택지 | gemini-3.1-flash-tts-preview의 권장 대체 모델 |
짧은 광고의 캐릭터 연기를 비교한다면 Flash부터, 안내문을 여러 언어로 많이 읽힌다면 Lite부터 같은 대본을 시험해 볼 수 있습니다. Lite도 음성 복제와 표현 지시를 지원하므로, 목소리 기능 하나만 보고 무조건 Flash로 좁힐 이유는 적습니다. 같은 API 스키마와 프롬프트 구조를 쓰는 점도 모델을 바꿔 비교하기 편하게 합니다. (Flash·Lite 비교)
지원 언어 수는 기능의 범위를 보여 줍니다. 한국어가 목록에 있다는 사실과 한국어 안내 방송이 자연스럽게 들리는지는 별도로 판단합니다. 고유명사·외래어·날짜·전화번호처럼 본인의 대본에 자주 나오는 표현을 넣어 들어 보면 좋습니다. 아래 샘플도 숫자와 시간, 영어 제품명을 섞어 만든 이유가 여기에 있습니다. (지원 언어 목록)
목소리를 만들고 대사마다 연기를 시키려면 무엇이 달라지나요?
첫째는 Voice Design, 목소리 설계입니다. 미리 정해진 음성 하나를 고르는 대신 역할·억양·목소리 특징을 자연어로 설명해 새 목소리를 만듭니다. Google 발표는 Flash로 캐릭터 목소리를 설계하는 예시를 보여 줍니다. 라디오 진행자나 게임 속 인물의 목소리를 만들고, 같은 목소리로 여러 대사를 이어 제작하는 방식입니다. (공식 발표의 목소리 설계)
둘째는 음성 라이브러리와 저장입니다. 발표는 바로 사용할 수 있는 음성을 2,000개 이상 제공하며, 설계한 목소리도 저장·관리해 다음 작업에 재사용하도록 안내합니다. API 문서에서는 음성 목록을 GET /v1beta/voices로 가져오고 설계·복제한 목소리를 voice_... ID로 지정합니다. 저장 음성이 기본이며, 복제 음성에는 선택 가능한 무상태 voicekey_... 방식도 나옵니다. 반복 제작에서는 같은 목소리를 재사용하는 관리 방법까지 생각하면 좋습니다. (음성 생성 문서 · Flash 문서)
셋째는 대사별 연출입니다. 같은 화자라도 문장마다 감정·속도·억양을 바꾸고, 웃음·한숨·짧은 멈춤 같은 순간적인 소리를 넣습니다. 지속되는 말투는 speech_metadata.style에, 순간 소리는 <laugh>나 <sigh> 같은 태그로 대본에 넣는 구조입니다. 목소리의 정체성을 설계하는 단계와 특정 대사의 연기를 지시하는 단계를 나누면 긴 원고를 고칠 때도 필요한 부분만 조절하기 좋습니다. (대사별 지시 안내)
Voice Remix는 라이브러리 음성의 음색·높낮이·속도·억양을 다시 조정하는 기능으로 소개됐습니다. 다만 발표 당시에는 곧 제공할 기능으로 적혀 있습니다. 지금 이용할 기능을 고를 때는 Voice Design·기존 음성 선택·대사별 지시와 구분합니다. (발표의 Voice remixing 항목)
이전 세대보다 좋아졌다는 평가는 어디까지 믿을 수 있나요?
Google은 음질·연기·억양·장문 안정성을 강조합니다. 같은 과제로 비교한 외부 평가를 함께 보면 무엇이 좋아졌는지 좀 더 구체적으로 살펴볼 수 있습니다. Hume은 미리 보기 모델을 평가했고 각 음성 클립을 모델 이름을 가린 채 세 명의 평가자가 들었습니다. 모델마다 같은 과제·질문·채점 기준을 적용했다고 설명합니다. (Hume 평가 방법)
| Hume 평가 항목 | 비교 결과 | 제작자가 살펴볼 부분 |
|---|---|---|
| 확장 장문 안정성, 5점 척도 | Gemini 3.1 Flash TTS 1.22 → Flash 2.89, Lite 3.03 | 긴 낭독에서 목소리와 발화가 안정적으로 이어지는지 |
| Expressivity–Reliability Frontier Score | Flash 0.920, Lite 0.914, Gemini 2.5 Pro TTS 0.880, 2.5 Flash TTS 0.861 | 표현력과 신뢰도를 함께 보는 외부 종합 지표 |
| 복제 화자 유사도, 5점 척도 | Flash 3.53, Lite 3.68, 평가 모델 평균 3.69 | 자연스러움과 원래 사람을 닮는 정도를 구분 |
| 젊은 성인 목소리 지정 정확도 | Flash 34.0%, ElevenLabs v3 68.1% | 구체적인 나이 속성을 맞추는 정도 |
| 음량 제어 성공률 | Flash 56.9%, Inworld Voice Design 88.9% | 원하는 음량 지시를 따르는 정도 |
장문 안정성의 상승은 긴 원고를 다루는 제작자에게 특히 반갑습니다. 이 평가에서는 Lite의 장문 안정성과 화자 유사도 수치가 Flash보다 높습니다. 모델 이름의 등급과 모든 세부 항목의 우열이 일치하지 않는다는 점을 보여 줍니다. Flash의 연기 표현력이 필요한지, Lite로도 원하는 목소리와 안정성을 얻는지 대본별로 비교할 이유가 생깁니다. (Hume 세부 분석)
0.920을 정확도 92%로 읽으면 지표의 의미가 달라집니다. Hume은 표현력·신뢰도 두 축에서 이상적인 지점에 얼마나 가까운지 계산한 점수라고 설명합니다. 또한 Google과 비독점 라이선스 관계가 있다고 공개하며, 평가용 대본·참조 자료는 개발팀에 공유하지 않는다고 밝혔습니다. 관계와 평가 방법을 함께 놓고 보는 외부 시험 결과입니다. 한국어 장편 오디오북 한 권의 성공률로 옮겨 읽기보다, 어떤 항목을 직접 들어 볼지 정하는 데 활용할 수 있습니다. (지표 설명과 관계 공개)
사람들이 듣고 고른 순위도 높은가요? (9월 30일 기준)
Artificial Analysis의 Provider Voice 순위표는 각 업체가 제공하는 목소리를 비교합니다. 두 음성을 블라인드로 들려주고 선호도를 모으므로, 대본 지시를 빠짐없이 따랐는지 검사하는 시험과 성격이 다릅니다. Elo는 상대 선호를 점수로 표현한 값입니다. (Provider Voice 순위표)
| 모델 | 순위 | Elo | 표시된 95% 신뢰구간 |
|---|---|---|---|
| ElevenLabs Eleven v4 | 1위 | 1316 | ±19 |
| Cartesia Sonic 3.6 | 2위 | 1275 | ±16 |
| Gemini 3.8 Flash TTS | 3위 | 1268 | ±16 |
| Qwen-Audio-3.0-TTS-Plus | 4위 | 1258 | ±16 |
| Gemini 3.8 Flash-Lite TTS | 7위 | 1240 | ±15 |
Flash와 Lite 모두 높은 선호 점수를 받았지만 가까운 모델들은 신뢰구간이 겹칩니다. 순위 한 칸 차이만으로 한국어 광고나 특정 화자 복제의 품질을 단정하기보다 직접 필요한 대본을 들어 보면 좋습니다. 이 표는 Google 공식 벤치마크가 아니라 9월 30일 확인한 외부 순위입니다. 이후 투표와 참가 모델이 늘면 순위도 달라집니다. (점수·신뢰구간·참가 모델)
한국어로 만들어 보니 어떻게 읽었나요?
2026년 9월 27일, Gemini API로 두 모델에 같은 한국어 원고를 넣어 음성을 만들었습니다. 숫자, 시간, 금액, 영어 단어를 일부러 섞어 발음을 시험했습니다. 목소리는 기본 음성 Kore, 말투 지시는 "차분하고 또렷한 뉴스 진행자"로 같게 했습니다.
안녕하세요, 오늘의 IT 소식입니다. 구글이 9월 23일 새 음성 모델 두 가지를 내놨습니다. 오디오 1시간을 만드는 데 약 0.81달러, 우리 돈으로 1,100원 남짓입니다. 오후 3시 45분 기준으로 AI Studio에서 무료로 써볼 수 있습니다.
Flash TTS
Flash-Lite TTS
두 사람 대화도 만들어 봤습니다. Flash TTS에 화자 두 명(Kore, Puck)을 지정하고, 대본 중간에 웃음과 놀라는 소리를 넣었습니다.
A: 이번에 나온 구글 음성 모델, 한국어도 진짜 자연스러워요?
B: (웃음) 직접 들어 보시면 알 거예요. 제 목소리도 사실 AI거든요.
A: (놀람) 에이, 설마요. 방금 웃음소리까지 넣은 거예요?
B: 네, 대본에 웃으라고 한 줄 적었을 뿐이에요.
만들어 보고 확인한 것은 이렇습니다.
| 항목 | Flash 낭독 | Flash-Lite 낭독 | Flash 대화 |
|---|---|---|---|
| 오디오 길이 | 20.5초 | 20.5초 | 18.5초 |
| 생성에 걸린 시간 | 10.3초 | 9.1초 | 10.3초 |
| 출력 토큰 | 651 | 652 | 588 |
- 발음: 만든 음성을 다시 Gemini로 받아써 원고와 비교했습니다. "구월 이십삼일", "영 점 팔일 달러", "천백 원", "세 시 사십오 분", "에이아이 스튜디오"까지 세 음성 모두 원고대로 읽혔습니다.
- 연기 지시: 대화 샘플에서는 웃음과 놀라는 소리가 대본에 넣은 위치에서 나왔고, 두 화자의 목소리도 구분됐습니다.
- 속도: 20초 안팎의 음성이 10초 정도에 만들어졌습니다. 한 번씩만 잰 값이라 네트워크 상황에 따라 달라질 수 있습니다.
- 비용 추정: 응답에 표시된 출력 토큰을 길이로 나누면 초당 약 32개로, 가격 안내의 초당 25토큰보다 많았습니다. 표시된 토큰을 모두 과금 대상이라고 가정하고 Standard 출력 단가를 적용하면, 세 샘플 합계는 약 0.015달러입니다. 실제 청구액이 아니라 출력 토큰으로 계산한 값이며 입력 비용은 제외했습니다.
듣기 좋은지는 사람마다 다르니 직접 들어 보고 판단해 보세요. 이 샘플은 한 번씩 만든 결과이고, 같은 원고라도 만들 때마다 억양이 조금씩 달라집니다. 받아쓰기로 원고를 대조한 결과와 사람이 듣고 판단하는 발음·자연스러움은 구분합니다. 대본 안의 원화 금액은 당시 읽기 시험용 문장으로, 현재 환율의 가격 안내와는 별개입니다.
오디오 1시간의 가격과 실제 제작비는 어떻게 계산하나요?
API 요금은 완성 파일의 글자 수보다 입력 텍스트와 출력 오디오 토큰으로 나눠 생각합니다. 오디오 토큰은 소리를 계산하는 단위입니다. Standard 출력 단가는 2026년 12월 31일까지 Flash $9, Lite $6/100만 토큰으로 안내됐으며, 초당 25토큰의 비율을 적용하면 아래와 같습니다. (Gemini API 가격 안내)
| 출력 길이 | Flash | Flash-Lite | 계산 조건 |
|---|---|---|---|
| 10초 | $0.00225 | $0.0015 | 출력 250토큰 |
| 1시간 | 약 $0.81 | 약 $0.54 | 출력 90,000토큰 |
| 완성 1시간을 세 번 생성 | 약 $2.43 | 약 $1.62 | 매번 1시간씩 생성했다고 가정 |
| 2027년 1월 1일 이후 1시간 | 약 $1.62 | 약 $1.08 | 출력 단가가 $18/$12로 오르는 일정 적용 |
여기서 1시간은 생성한 음성의 길이입니다. 완성본 1시간을 얻기까지 발음·연기를 고치며 세 번 생성했다면 생성량은 3시간이 됩니다. 세 번 생성 행은 그런 상황을 보여 주는 계산 예시입니다. 입력 텍스트, 캐시 저장, 편집 비용과 세금은 이 출력 비용 표에 합치지 않았습니다. Notebook·Vids의 구독료와도 구분합니다. 제품 안에서 쓰는 기능의 비용과 개발자가 API로 호출하는 비용은 서로 다른 항목입니다. (API 요금 체계)
짧은 시제품에서는 두 모델의 단가 차이보다 다시 생성하는 횟수가 더 크게 작용할 수 있습니다. 위 표의 계산대로라면 Flash 한 번으로 얻는 1시간보다 Lite 두 번의 1시간 생성 비용이 더 큽니다. 같은 대본을 두 모델로 만들고, 원하는 발음·감정에 도달하기까지 몇 번 다시 만들었는지를 적으면 단가 비교를 실제 제작비 비교로 바꿀 수 있습니다. 이는 예산을 잡는 방법이며 두 모델의 재생성률을 측정한 결과는 아닙니다.
모델 문서는 Batch API, Flex, Priority도 지원 옵션으로 나열합니다. 대량 원고를 묶어 처리할지, 사용자가 기다리는 음성 응답을 만들지에 따라 고르는 항목입니다. 9월 30일 가격표의 출력 단가(100만 오디오 토큰, 2026년 12월 31일까지)는 아래와 같습니다. 2027년 1월 1일부터는 모두 두 배가 됩니다. (처리 옵션 목록 · 가격표)
| 처리 옵션 | Flash 출력 | Flash-Lite 출력 | 고르는 경우 |
|---|---|---|---|
| Standard | $9.00 | $6.00 | 기본 호출 |
| Batch·Flex | $4.50 | $3.00 | 바로 듣지 않아도 되는 대량 원고 |
| Priority | $16.20 | $10.80 | 사용자가 기다리는 실시간 응답 |
입력 텍스트는 Standard 기준 두 모델 모두 100만 토큰에 $0.50(2027년부터 $1.00)입니다. Batch·Flex 출력은 Standard의 절반이므로 같은 계산으로 Flash 약 $0.405, Lite 약 $0.27이 1시간 출력 비용입니다. 캐시 저장료는 100만 토큰·시간당 $0.50(2027년부터 $1.00)으로 따로 붙습니다. 무료 등급은 가격이 무료로 표시되지만 앞서 적은 것처럼 입력 데이터가 제품 개선에 쓰입니다.
한국에서 어디로 들어가면 써볼 수 있나요?
화면에서 시험하려면 Google AI Studio의 Flash TTS 화면이나 Flash-Lite TTS 화면으로 들어갑니다. 개발자는 Gemini API에서 모델 ID를 지정합니다. Google의 지원 지역 목록에는 대한민국이 포함되고, 두 모델의 언어 목록에도 한국어가 나옵니다. 지역·언어 지원과 별개로 목소리 설계·복제 같은 기능은 실제 계정 화면에서 접근 상태를 확인하면 됩니다. (지역 목록 · 모델과 언어)
일반 사용자 제품에서는 Flash가 Gemini Notebook, Lite가 Google Vids에 들어갑니다. Google 발표의 기업용 API 경로는 두 모델 모두 Gemini Enterprise에서 곧 제공한다고 적혀 있습니다. 개발자 API에서 모델을 호출하는 것, 일반 제품의 음성 기능을 사용하는 것, 기업용 플랫폼으로 도입하는 것을 따로 살펴보면 혼동을 줄일 수 있습니다. (제품별 제공 경로)
Gemini API의 일반 가격 안내는 무료 등급의 입력·출력을 제품 개선에 사용한다고 표시하며, 유료 등급은 제품 개선에 사용하지 않는다고 표시합니다. 무료 시험에서 회사의 비공개 대본이나 개인 음성 자료를 다룬다면 가격뿐 아니라 데이터 처리 조건도 함께 살펴보면 좋습니다. (무료·유료 등급 안내)
처음 시험할 때는 대본 한 문단으로 발음과 출력 파일을 확인하고, 실제 제작 대본으로 길이를 늘리는 순서가 편합니다. 음성 상담이라면 답변 생성 시간과 TTS 생성 시간을 나눠 재고, 콘텐츠 제작이라면 다시 만든 횟수를 함께 기록합니다. 20초짜리 샘플 한 번으로 장편 오디오북의 처리 속도를 예상하기보다, 자신의 대본 길이와 네트워크 조건에서 측정할 수 있는 방법입니다.
기존 3.1 API를 붙였다면 무엇을 바꿔야 하나요?
가장 큰 변화는 대본을 그대로 읽는 입력 방식입니다. Say cheerfully: Hello!처럼 연기 지시와 말을 한 문자열에 넣으면 지시 문구까지 소리로 나올 수 있다고 문서가 설명합니다. 실제 발화문은 텍스트에 두고, 화자와 지속되는 스타일을 speech_metadata에 분리합니다. 두 모델의 같은 API 구조를 활용하면 이 변경을 한 뒤 모델 ID를 바꿔 비교하기 좋습니다. (이전 안내)
- GenerateContent API에서는 각
part에speech_metadata의speaker와style을 붙입니다. - Interactions API에서는 텍스트 블록의
annotations에type: "speech_metadata"를 넣습니다. - 다중 화자에서는 매 턴마다 설정된 화자 중 하나를
speaker로 명시합니다. - 순간 소리는
<laugh>,<sigh>,<short pause>같은 태그로 남기고, 속삭이는 말투처럼 지속되는 연출은style로 옮깁니다.
예전 원고의 Speaker 1: 같은 이름표, 긴 감독 지시문, 발화 문장이 한 문자열에 섞여 있다면 각각 어느 칸에 들어갈지 먼저 나눠 보세요. 캐릭터를 반복 사용하는 경우는 Voice Design으로 음성 ID를 만들고, 대사에서는 짧은 스타일 지시만 바꾸는 방법을 문서가 권합니다. (프롬프트 구조와 음성 ID)
다른 변화는 오디오 파일 형식입니다. 이전 TTS는 기본값으로 헤더 없는 PCM을 돌려줬지만 3.8의 단일 요청 기본 출력은 RIFF 헤더가 있는 WAV입니다. PCM은 소리의 원시 데이터, WAV는 재생에 필요한 헤더를 함께 담은 파일 형식입니다. 기존 코드가 PCM 앞에 WAV 헤더를 붙였다면 지금은 받은 WAV를 다시 감싸게 됩니다. 문서는 기존 래퍼를 제거하고 반환된 바이트를 .wav로 저장하거나, 원시 PCM이 필요한 경우 audio/l16 형식을 명시하도록 안내합니다. (출력 형식 이전 안내)
기본값과 길이 제한은 어디까지인가요?
두 모델은 음성 생성용으로 설계돼 Thinking, 함수 호출, 검색 접지, 구조화 출력을 지원하지 않습니다. Thinking은 답변 전 추론을 조절하는 기능, 검색 접지는 웹 자료를 찾아 응답 근거를 붙이는 기능입니다. TTS에 사실 확인이나 대본 작성까지 맡기기보다, 먼저 검토한 발화문을 음성으로 바꾸는 구조에 맞춰 쓰면 됩니다. (모델 기능 표)
Gemini API의 제공 한도는 입력 8,192토큰, 출력 16,384토큰입니다. 초당 25토큰을 단순 적용하면 출력 최대치는 약 10분 55초입니다. 이 숫자는 호출 한도의 환산이지, 모든 대본에서 같은 길이가 나오는 약속은 아닙니다. 모델 카드에는 더 큰 출력 능력이 기재돼 있지만 API 호출을 설계할 때는 개발자 문서의 serving limit을 기준으로 잡습니다. (API 한도 · Audio 모델 카드)
긴 원고는 장이나 장면 단위로 나누고, 음성 ID·말투·등장인물 이름을 유지하며 생성하는 방법을 생각할 수 있습니다. Google이 설명하는 장문 안정성은 목소리가 이어지는 품질에 관한 특성이며 한 번의 API 호출 길이와는 구분합니다. 나눠 만든 음성은 연결 지점의 억양·음량을 들어 보고, 어색한 부분만 다시 만드는 방식으로 작업량을 조절할 수 있습니다. (장문 안정성 및 화자 관리)
실제 목소리를 복제할 때 어떤 조건이 있나요?
Voice Replication은 30초 음성 샘플로 그 사람의 목소리를 재현하는 기능입니다. Google은 본인 또는 사용 권리를 가진 목소리를 대상으로 하고, 음성 주인이 동의를 말로 녹음한 뒤 기준 화자와 일치하는지 확인하는 절차를 설명합니다. 권한을 확인한 녹음과 동의 자료를 준비하는 과정까지 제작 일정에 넣으면 단순한 파일 업로드 기능으로 생각할 때 생기는 차이를 줄일 수 있습니다. (복제 기능과 동의 확인)
발표의 지역 제한은 AI Studio의 음성 복제에 관한 항목입니다. EEA·영국·스위스·인도와 미국 일리노이·텍사스에서는 제공하지 않는다고 적혀 있습니다. 한국은 그 제한 목록에 없지만 실제 기능이 보이는지와 해당 제품의 조건을 함께 확인합니다. (AI Studio 복제 제한 각주)
Google은 생성 오디오에 귀로 들리지 않는 SynthID 워터마크를 넣고, 복제 기능에 C2PA 출처 정보를 사용한다고 설명합니다. SynthID는 AI가 만든 소리를 식별하기 위한 신호, C2PA는 콘텐츠의 출처·제작 정보를 기록하는 표준입니다. 이런 표시는 생성물 식별에 도움을 주고, 실제 사람의 동의·사용 권한 확인은 별도 절차로 남습니다. (안전장치 설명)
모델 카드는 환각 같은 일반적인 한계, 간헐적인 지연·시간 초과, 계속 강화하는 jailbreak 방어도 적고 있습니다. Jailbreak는 제한된 동작을 유도하려고 안전 지침을 우회하는 입력을 뜻합니다. 음성 앱에서는 모델의 안전장치에 더해 사용자 입력, 복제 권한, 출력 점검을 각각 관리하는 관점이 중요합니다. (알려진 한계)
최근 반응은 어떤가요? (2026년 9월 30일 기준)
Hacker News 출시 토론은 확인한 원문에서 331점·153댓글이 표시됐습니다. 토론에는 제품별로 모델과 기능이 다르게 제공돼 헷갈린다는 댓글이 이어집니다. 한 이용자는 회사가 일반 소비자·개인 개발자용 서비스를 막으면 새 기능을 쓸 경로가 불확실해진다고 말했고, 다른 이용자들도 계정·제품별 제공 차이를 이야기했습니다. 이것은 제품 도입에서 겪는 댓글 사례로 읽었습니다.
가격을 다룬 댓글도 있었습니다. 한 이용자는 25만 단어 분량의 오디오북 작업을 Gemini로는 약 $15, ElevenLabs로는 약 $75로 본인이 추산하며 "쓰느냐 마느냐를 가르는 차이"라고 했습니다. 개인 계산이라 표준 비교는 아니지만, 위 단가 표가 실제 도입 판단에 쓰이는 사례입니다. 다른 댓글은 Voice Design 오류와 일부 지역의 음성 복제 제한, 동의 녹음 보관 기간에 대한 궁금증을 전했습니다.
음성 복제에서는 일부 이용자가 Qwen 계열 공개 모델을 로컬에서 써 본 경험을 들었습니다. 한 댓글은 자기 음성 녹음·정리·미세 조정을 거쳐 목소리를 만들었다고 설명하며, 다른 댓글들은 복제가 이미 널리 가능해졌다는 쪽으로 이야기합니다. 반대로 오용과 사기에 대한 우려, 목소리를 잃는 사람이 자기 목소리를 보존하는 접근성 용도도 언급됐습니다. (복제 경험·용도에 관한 댓글)
이 사례는 Gemini 한국어 결과의 품질 평가와 구분합니다. 다른 모델로 만든 경험이 섞여 있고, 출시 기능에 대한 기대와 실제 사용담도 함께 있습니다. 한국어 대본을 두 Gemini 모델로 비교한 외부 후기는 여기서 인용할 자료를 찾지 못했습니다. 이 블로그의 짧은 샘플을 들어 보고, 본인의 대본으로 비교를 이어 갈 수 있습니다.
시제품과 대량 제작에서 무엇부터 비교하면 좋을까요?
짧은 시제품이라면 같은 원고·같은 목소리·같은 스타일로 Flash와 Lite를 한 번씩 만들어 들어 보는 방식으로 시작합니다. 숫자와 외래어 발음, 화자 구분, 감정 지시 중 무엇이 중요한지 먼저 정하면 종합 순위보다 자신의 작업에 맞는 답을 얻기 쉽습니다. 복제가 핵심이면 자연스러움뿐 아니라 원래 화자와 닮았는지도 따로 비교합니다. Hume의 자연스러움과 화자 유사도 결과가 다른 점이 그 이유를 보여 줍니다. (세부 평가)
대량 제작은 최종 채택한 음성 1시간당 생성량을 적어 보면 좋습니다. 한 번에 채택된 부분, 발음 때문에 다시 만든 부분, 스타일을 고치며 재생성한 부분을 나누면 단가가 싼 모델과 실제 총비용이 적은 모델을 비교할 수 있습니다. 내년까지 이어지는 작업이라면 출시 가격의 종료 일정도 예산에 반영합니다. API를 이미 붙였다면 그 비교 전에 대본 지시의 위치와 WAV 저장 처리를 고치는 것부터 시작할 수 있습니다. (요금표 · 이전 안내)
참고한 자료
- Google 공식 발표 — 2026-09-23 발표, 기능·제품 경로·복제 제한.
- Flash TTS 문서 · Flash-Lite TTS 문서 — 용도·지원 언어·API 한도·이전 안내.
- 음성 생성 안내 — 화자·스타일 구조와 출력 파일 형식.
- Gemini API 가격표 · 지원 지역.
- Gemini 3.8 Audio 모델 카드 — 제공 경로·일반 한계.
- Hume Real-World VoiceEQ 평가 — 블라인드 평가 방법·세부 점수·관계 공개.
- Artificial Analysis Provider Voice 순위표 — 9월 30일의 선호 점수·순위·신뢰구간.
- Hacker News 출시 토론 — 제품 접근성과 음성 복제 관련 댓글 사례.
기능·평가 자료는 2026년 9월 30일 확인했습니다. 한국어 샘플의 제작일은 9월 27일이며, 가격 계산은 당시 안내된 API 단가를 적용했습니다.