구글이 9월 23일 음성 생성(TTS) 모델 두 가지를 내놨습니다. 글로 쓴 대본을 사람 목소리로 읽어 주는 모델인데, 이번에는 목소리를 새로 만들고 대사마다 연기를 지시하는 기능이 들어갔습니다.

  • Gemini 3.8 Flash TTS: 캐릭터 목소리와 섬세한 연기에 초점을 맞춘 모델입니다. 게임, 오디오북, 팟캐스트를 겨냥했습니다.
  • Gemini 3.8 Flash-Lite TTS: 더 싸고 빠르게 많은 양을 만드는 모델입니다. 더빙, 음성 상담, 글 읽어 주기 기능을 겨냥했습니다.

반응을 먼저 요약하면, 외부 블라인드 평가에서 최상위권에 올랐고 가격이 싸다는 호평이 많습니다. 반면 기본 음성이 다 비슷하게 들린다는 아쉬움도 나옵니다. 한국어 후기는 아직 드물어서, 두 모델로 한국어 음성을 직접 만들어 아래에 올려 두었습니다.

두 모델, 무엇이 다른가

Flash TTS Flash-Lite TTS
잘하는 일 목소리 설계, 감정·억양 연기 대량 생성, 실시간 음성 응답
지원 언어 130개 이상 100개 이상
오디오 1시간 비용 (가격 안내 기준, 2026년 말까지) 약 0.81달러 약 0.54달러
모델 ID gemini-3.8-flash-tts gemini-3.8-flash-lite-tts

두 모델 모두 정식 버전이고, 기존 gemini-3.1-flash-tts-preview를 대신합니다. 한국어는 두 모델의 지원 언어 목록에 들어 있습니다. (Flash TTS 문서 · Flash-Lite TTS 문서)

무엇을 할 수 있나

목소리를 글로 설계합니다. 예를 들어 "낮고 차분한 목소리의 라디오 진행자"처럼 원하는 목소리를 글로 적으면 새 목소리를 만들어 줍니다. 바로 쓸 수 있는 기본 음성도 2,000개 넘게 준비돼 있습니다.

대사마다 연기를 지시합니다. 줄마다 속도와 감정을 따로 정할 수 있고, 웃음·한숨·헉 하는 소리나 "음", "그렇죠" 같은 맞장구도 대본에 넣을 수 있습니다. 두 사람이 주고받는 대화도 대본 하나로 만들 수 있습니다. 구글은 몇 시간 분량의 긴 오디오에서도 목소리가 일정하게 유지된다고 설명합니다.

실제 사람 목소리를 복제합니다. 약 30초 분량의 녹음이 있으면 그 목소리를 재현할 수 있습니다. 다만 목소리 주인이 직접 음성으로 동의하는 절차를 거쳐야 하고, 유럽경제지역(EEA)·영국·스위스·인도와 미국 일리노이·텍사스에서는 이 기능을 쓸 수 없습니다. 한국은 제한 지역에 들어 있지 않습니다.

만들어진 음성에는 귀로는 들리지 않는 SynthID 워터마크가 들어가고, AI 생성물임을 표시하는 C2PA 정보도 붙습니다. (구글 발표)

성능은 어느 정도인가 (2026년 9월 27일 기준)

외부 비교 사이트에서 최상위권에 올랐습니다. 순위표는 새 모델이 나올 때마다 바뀌니, 아래 순위는 9월 27일에 확인한 기록입니다.

  • Artificial Analysis 음성 아레나: 사람들이 두 음성을 블라인드로 듣고 더 나은 쪽을 고르는 순위입니다. Flash TTS가 Elo 1268로 2위, 1위는 Cartesia Sonic 3.6(1277)입니다. Flash-Lite TTS는 5위(1240)로, ElevenLabs Eleven v3(17위)나 OpenAI TTS-1 HD(32위)보다 높습니다. (순위표)
  • 발음 정확도: 같은 곳의 발음 견고성 평가에서 Flash TTS가 89.5%로 1위에 올랐습니다. (Artificial Analysis 발표)
  • Hume AI VoiceEQ: 표현력과 안정성을 함께 보는 평가에서 Flash TTS(0.920)와 Flash-Lite TTS(0.914)가 1, 2위를 차지했습니다. (Hume AI 블로그)

구글은 언어별 순위에서 일본어, 브라질 포르투갈어, 베트남어, 아랍어, 멕시코 스페인어, 힌디어 1위를 내세웠습니다. 이 목록에 한국어는 없습니다.

반응은 어떤가 (2026년 9월 27일 기준)

해외 개발자 커뮤니티 Hacker News에서는 330점, 댓글 150여 개가 달리며 관심을 모았습니다.

  • 좋다는 쪽: 표현력이 ElevenLabs v3에 견줄 만하다는 평가와, 이 가격이면 개인 개발자나 오디오북 제작자도 부담 없이 쓸 수 있다는 반응이 많았습니다.
  • 아쉽다는 쪽: 기본 음성들이 비슷비슷한 "Gemini 목소리"로 들린다는 지적, 감정 표현이 과장돼 거슬린다는 의견이 나왔습니다. 제품마다 들어간 모델과 기능이 달라 헷갈린다는 불만도 있었고, Qwen3 TTS 같은 공개 모델도 충분히 좋다는 반론도 있었습니다.

일본에서는 자연스러운 일본어 음성이 화제가 되며 X 트렌드에 올랐습니다. 국내에서는 출시 소식을 전하는 기사가 대부분이고, 한국어 음질을 직접 비교한 후기는 아직 찾기 어렵습니다.

한국어로 직접 만들어 봤습니다

2026년 9월 27일, Gemini API로 두 모델에 같은 한국어 원고를 넣어 음성을 만들었습니다. 숫자, 시간, 금액, 영어 단어를 일부러 섞어 발음을 시험했습니다. 목소리는 기본 음성 Kore, 말투 지시는 "차분하고 또렷한 뉴스 진행자"로 같게 했습니다.

안녕하세요, 오늘의 IT 소식입니다. 구글이 9월 23일 새 음성 모델 두 가지를 내놨습니다. 오디오 1시간을 만드는 데 약 0.81달러, 우리 돈으로 1,100원 남짓입니다. 오후 3시 45분 기준으로 AI Studio에서 무료로 써볼 수 있습니다.

Flash TTS

Flash-Lite TTS

두 사람 대화도 만들어 봤습니다. Flash TTS에 화자 두 명(Kore, Puck)을 지정하고, 대본 중간에 웃음과 놀라는 소리를 넣었습니다.

A: 이번에 나온 구글 음성 모델, 한국어도 진짜 자연스러워요?
B: (웃음) 직접 들어 보시면 알 거예요. 제 목소리도 사실 AI거든요.
A: (놀람) 에이, 설마요. 방금 웃음소리까지 넣은 거예요?
B: 네, 대본에 웃으라고 한 줄 적었을 뿐이에요.

만들어 보고 확인한 것은 이렇습니다.

Flash 낭독 Flash-Lite 낭독 Flash 대화
오디오 길이 20.5초 20.5초 18.5초
생성에 걸린 시간 10.3초 9.1초 10.3초
출력 토큰 651 652 588
  • 발음: 만든 음성을 다시 Gemini로 받아써 원고와 비교했습니다. "구월 이십삼일", "영 점 팔일 달러", "천백 원", "세 시 사십오 분", "에이아이 스튜디오"까지 세 음성 모두 원고대로 읽혔습니다.
  • 연기 지시: 대화 샘플에서는 웃음과 놀라는 소리가 대본에 넣은 위치에서 나왔고, 두 화자의 목소리도 구분됐습니다.
  • 속도: 20초 안팎의 음성이 10초 정도에 만들어졌습니다. 한 번씩만 잰 값이라 네트워크 상황에 따라 달라질 수 있습니다.
  • 비용: 응답에 표시된 출력 토큰은 오디오 1초당 약 32개로, 가격 안내의 초당 25토큰보다 많았습니다. 이 비율대로라면 Flash로 1시간을 만들 때 약 1.03달러가 됩니다. 유료 가격으로 계산하면 이번 샘플 세 개는 모두 합쳐 약 1.5센트(20원 남짓)입니다.

듣기 좋은지는 사람마다 다르니 직접 들어 보고 판단해 보세요. 이 샘플은 한 번씩 만든 결과이고, 같은 원고라도 만들 때마다 억양이 조금씩 달라집니다.

어디서, 어떻게 써볼 수 있나

가장 쉬운 방법은 Google AI Studio입니다. Flash TTS 화면이나 Flash-Lite TTS 화면에 대본을 넣으면 바로 들어볼 수 있습니다. 개발자는 Gemini API에서 위 모델 ID로 호출하면 되고, 두 모델 모두 무료 등급이 있습니다.

일반 사용자용 제품에는 모델이 하나씩 들어갔습니다. Gemini Notebook에는 Flash TTS, Google Vids에는 Flash-Lite TTS가 쓰입니다. 기업용 Gemini Enterprise에는 곧 들어갈 예정입니다.

유료 가격은 오디오 출력 100만 토큰당 Flash 9달러, Flash-Lite 6달러입니다. 오디오 1초가 25토큰이라 1시간이면 약 9만 토큰이고, 위 표의 시간당 비용은 이렇게 계산했습니다. 이 가격은 2026년 12월 31일까지의 출시 가격입니다. 2027년 1월 1일부터는 두 배(Flash 18달러, Flash-Lite 12달러)로 오르니, 장기 예산은 오른 가격으로 잡아 두면 됩니다. 급하지 않은 작업은 Batch API로 돌리면 절반까지 싸집니다. (가격 안내)

한 번 요청으로 받을 수 있는 오디오는 최대 16,384토큰, 약 11분 분량입니다. 오디오북처럼 긴 원고는 나눠서 만들어야 합니다.

참고한 자료

모두 2026년 9월 27일에 확인했습니다. 가격과 순위는 바뀔 수 있습니다.