Gemini 3.8 음성 생성 모델 2종 — 목소리 설계와 이용 범위

Flash·Flash-Lite TTS의 차이, 사용 가능한 곳, 음성 복제의 동의·지역 제한을 확인했습니다.

Google이 2026년 9월 23일 음성 생성 모델 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 발표했습니다. 글을 읽어 주는 수준을 넘어, 캐릭터의 목소리를 설계하고 대사마다 감정과 말의 속도를 지정할 수 있게 한 것이 핵심입니다. 두 모델의 쓰임새와 제공 범위는 다릅니다.

두 모델은 어떻게 다른가요?

Flash TTS는 창작 과정의 세밀한 연출에 초점을 맞췄습니다. 자연어로 목소리의 특징을 설명하고, 대사별 억양·감정·속도 등을 지시할 수 있습니다. 오디오북, 게임 캐릭터, 팟캐스트처럼 한 인물의 목소리와 연기가 중요한 작업을 염두에 둔 모델입니다. Flash-Lite TTS는 대량 더빙이나 음성 에이전트처럼 많은 음성을 효율적으로 만들어야 하는 경우에 맞춰졌습니다.

Google은 다양한 언어와 지역별 발음을 지원한다고 발표했습니다. 다만 ‘지원 언어가 많다’는 사실만으로 특정 언어의 자연스러움이나 고유명사 발음이 충분하다고 판단할 수는 없습니다. 한국어 서비스를 만든다면 같은 대본으로 발음, 숫자 읽기, 대화의 일관성을 직접 들어 보고 결정하는 것이 좋습니다.

지금 실제로 쓸 수 있는 곳은?

  • 개발자: 두 모델 모두 Gemini API와 Google AI Studio에서 순차 제공됩니다.
  • 일반 이용자: Flash TTS는 Gemini Notebook, Flash-Lite TTS는 Google Vids에서 제공된다고 안내됐습니다.
  • 기업: Gemini Enterprise API 제공은 발표 시점 기준 ‘곧 제공 예정’입니다. 이미 모든 기업 계정에서 이용할 수 있다는 뜻은 아닙니다.

순차 제공이므로 같은 날에도 계정과 지역에 따라 기능이 보이지 않을 수 있습니다.

목소리 복제는 아무 목소리나 가능한가요?

아닙니다. Google은 사용자가 자신의 목소리 또는 사용 권리를 가진 목소리의 짧은 샘플을 쓰도록 설명하며, 음성 소유자의 동의 녹음으로 확인하는 절차를 제시합니다. 생성 음성에는 SynthID 워터마크가 적용된다고 합니다. Google AI Studio의 음성 복제 기능은 일부 국가·지역에서 제공되지 않습니다. 따라서 타인의 목소리를 허락 없이 복제하거나 모든 나라에서 같은 기능을 쓸 수 있다고 안내해서는 안 됩니다.

어디에 먼저 적용해 볼 만할까요?

한국어·영어를 함께 제공하는 서비스라면 짧은 제품 소개와 도움말을 여러 목소리로 만들어 시험해 볼 수 있습니다. 영상 제작자는 같은 대사를 감정과 속도만 바꿔 비교할 수 있고, 앱 개발자는 대화형 안내 음성의 응답 속도와 품질을 확인할 수 있습니다. 공개 전에는 음성 사용 권리, 발음 검수, AI 생성 고지, 실제 API 비용을 점검해야 합니다. 이번 발표만으로 기존 성우 작업을 완전히 대체할 수 있다고 단정하지 않는 것이 정확합니다.

확인 기준: 2026년 9월 24일. 모델 기능, 제공 경로, 동의·워터마크 및 지역 제한은 Google 공식 발표를 기준으로 정리했습니다. 활용 사례와 검수 권고는 Infosence의 해석입니다.