Gemini 3.8 Flash TTS 및 Flash-Lite TTS 출시
TL;DR
Google DeepMind는 창작자가 맞춤형이고 표현력 있는 목소리를 생성하고, 줄 단위로 직접적인 연기 제어를 할 수 있도록 해주는 두 가지 새로운 텍스트-투-스피치 모델인 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash‑Lite TTS를 출시했습니다. 기업용 고용량, 비용 효율적인 확장성을 제공합니다.
Gemini 3.8 Flash TTS: 창의적 목소리 스튜디오
- 목적: 깊이 있는 창의적 지시와 캐릭터 디자인을 위해 설계됨.
- 기능: 자연어 프롬프트에서 완전히 새로운 목소리를 생성하고, 연기 지시, 리듬, 방언 전환, 백채널링을 제어할 수 있음.
- 사용 사례: 게임, 몰입형 오디오북, 팟캐스트, 인터랙티브 미디어, 그리고 맞춤형 캐릭터 목소리가 필요한 모든 상황.
- 목소리 라이브러리: 100개 이상의 언어와 방언(메히코 스페인어, 퀘벡 프랑스어, 스코틀랜드 영어 등 지역 변형 포함)을 포함한 2,000개 이상의 제작 준비 완료된 목소리에 접근 가능.
- 목소리 복제: 30초 샘플로 일관된 음성 프로필을 생성하며, 내장된 동의 확인, SynthID 워터마킹, C2PA 인증을 통해 목소리 예술가를 보호함.
- 미래 기능 – 목소리 리믹싱: 프롬프트를 통해 기존 라이브러리 목소리의 톤, 음고, 속도, 억양을 세밀하게 조정할 수 있는 기능이 계획됨.
Gemini 3.8 Flash‑Lite TTS: 확장 가능한 고용량 생성
- 목적: 고용량 더빙, 오디오 콘텐츠 생성, 표현력 있는 음성 에이전트를 위해 최적화됨.
- 효율성: 비용과 지연 시간을 최소화하면서 톤, 리듬, 세부 사항에 대한 세밀한 제어를 제공함.
- 대상 시나리오: 대규모 미디어 현지화, 음성 보조기기 배포, 그리고 빠르고 신뢰할 수 있는 음성 합성 필요 응용 프로그램.
정밀한 줄 단위 연기 제어
- 연기 지시: 사용자는 명시적인 스크립트 지시를 작성하거나, Gemini가 각 줄에 대해 자연어 지시를 해석하도록 할 수 있음.
- 장시간 생성: 수 시간에 걸친 지속적인 오디오에서도 높은 목소리 품질과 최소한의 화자 이탈을 유지하며, 팟캐스트와 오디오북에 이상적임.
- 이중 화자 장면 구성: 구분된 목소리 분리 기능을 통해 자연스러운 대화 중심 콘텐츠를 위한 네이티브 다중 회차 대화를 지원함.
- 음성 폭발 및 백채널링:
<laughs>,<sigh>와 같은 비언어적 신호 삽입 및|mhm|,|yeah|과 같은 수동적 청취 반응을 통해 현실적인 대화 텍스처를 구현할 수 있음.
벤치마크 성능 및 글로벌 품질
- Hume AI 목소리 디자인 벤치마크: Gemini 3.8 Flash TTS는 전반적으로 1위(점수 71.4)를 기록하며 억양 모델링에서 1위(점수 60.8)를 차지함.
- 전반적 품질 지수: Flash TTS는 1위, Flash‑Lite TTS는 2위를 기록함.
- 인간 선호 평가 (Voice Arena): 일본어, 브라질 포르투갈어, 베트남어, 현대 표준 아랍어, 메히코 스페인어, 힌디어를 포함한 주요 언어에서 두 모델 모두 최상위 위치를 달성함.
- 다국어 지원: 100개 이상의 언어를 지원하여 고품질 음성 경험의 전 세계 배포를 가능하게 함.
신뢰, 동의, 투명성 보호 조치
- 동의 확인: 목소리 복제는 참조 화자와 일치하는 목소리 소유자의 음성 동의 녹음이 필요함.
- 합성 워터마킹: 모든 오디오 출력에 인지할 수 없는 SynthID 워터마킹이 내장되어 AI 생성 음성이 탐지 가능하며, 오해의 소지가 있는 정보 유포를 방지함.
- 모델 카드: Gemini 3.8 오디오 모델 카드에서 안전성 및 책임에 대한 자세한 정보를 확인할 수 있음.
접근 및 통합 옵션
- Google AI Studio Playground: 음성 설계, 복제, 이중 화자 스크립트 편집을 지원하는 음성 생성 워크스페이스를 통해 즉시 실습 가능.
- Gemini API: Agora, LiveKit, Pipecat, Vercel과 같은 플랫폼과 통합하여 고성능 음성 인터페이스를 구축할 수 있음.
- 기업용 배포: Flash TTS는 Gemini Enterprise API를 통해 제공될 예정이며, Flash‑Lite TTS는 엔드유저를 위한 Google Vids를 통해 접근 가능할 예정임.
- 파트너 배포: Figma, HeyGen, Linguana, Wondercraft, 99.co, Ollang 등 초기 도입 기업들이 더빙, 지역 억양 현지화, 대화형 에이전트에 모델을 활용하고 있음.
시작하기
- 개발자: Gemini API와 Google AI Studio를 통해 두 모델 모두 접근 가능.
- 기업용: Gemini Enterprise API를 통해 곧 제공 예정.
- 일반 사용자: Flash TTS는 Gemini Notebook에, Flash‑Lite TTS는 Google Vids에 제공될 예정.
모든 정보는 2026년 9월 23일자 DeepMind 블로그 게시물에서 직접 인용됨.