Google Gemini 3.8 Flash 및 Flash‑Lite TTS 출시: 표현력이 풍부하고 확장 가능한 음성 생성
Gemini 3.8 Flash 및 Flash‑Lite TTS, 표현력이 풍부하고 확장 가능한 음성 생성의 기준을 높이다
Google은 2026년 9월 23일에 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash‑Lite TTS를 발표하며, 이들을 Gemini 제품군에서 가장 표현력이 뛰어난 오디오 생성 모델로 자리매김했습니다. 이 모델들을 통해 개발자는 맞춤형 캐릭터 음성을 만들고, 30초 샘플에서 기존 음성을 복제하며, 대사 단위로 전달 방식을 제어하는 동시에 대규모의 비용 효율적인 사용 사례를 지원할 수 있습니다.
즉시 사용 가능한 핵심 기능
Flash TTS는 깊이 있는 창의적 제어에 중점을 둡니다. 사용자는 자연어 프롬프트로 완전히 새로운 음성을 설계하고, 억양, 방언, 속도, 맞장구 신호를 지정할 수 있으며, 수 시간 분량의 오디오에서도 화자 변화 없이 다중 화자 장면을 생성할 수 있습니다.
Flash‑Lite TTS는 확장성을 목표로 합니다. 이 모델은 대량 더빙 및 음성 에이전트에 최적화되어 있으며, 더 낮은 비용으로 동일한 수준의 세밀한 톤 및 속도 제어 기능을 제공합니다.
두 모델 모두 다음을 지원합니다:
- 100개 이상의 언어와 지역 변형(예: 멕시코 스페인어, 퀘벡 프랑스어, 스코틀랜드 영어)을 아우르는 2,000개 이상의 프로덕션급 음성.
- 30초 분량의 동의된 샘플을 통한 음성 복제(SynthID 워터마킹 및 C2PA 자격 증명 내장).
<laughs>,<sigh>와 같은 직접적인 스크립트 큐 및 맞장구 토큰(|mhm|,|yeah|).- 수 시간 분량의 콘텐츠 전반에 걸쳐 음색을 유지하는 장문 생성.
벤치마크 성능으로 입증된 “가장 표현력이 뛰어난” 모델이라는 평가
Google은 Hume AI의 Voice Design Benchmark를 인용하며, Gemini 3.8 Flash TTS가 71.4(전체 1위) 및 억양 모델링에서 60.8을 기록하여 이전 모델인 Gemini 3.1 Flash TTS를 능가했다고 밝혔습니다. 동일한 벤치마크에서 Flash‑Lite TTS는 전체 품질 2위를 차지했습니다. Voice Arena의 인간 선호도 테스트에서도 두 모델은 일본어, 브라질 포르투갈어, 베트남어, 현대 표준 아랍어, 멕시코 스페인어, 힌디어 등 여러 글로벌 언어에서 최상위권에 올랐습니다.
신뢰, 동의, 워터마킹이 파이프라인에 내장됨
음성 복제를 위해서는 참조 화자와 일치하는 구두 동의 녹음이 필요합니다. 동의 오디오는 확인 목적으로만 저장되며 모델 학습에는 사용되지 않습니다. 생성된 모든 클립에는 감지할 수 없는 SynthID 워터마크가 포함되어 있어 AI 생성 음성을 사후에 탐지하고 허위 정보 확산을 완화하는 데 도움을 줍니다.
Google AI 생태계 전반에서의 가용성
| 플랫폼 | Flash TTS | Flash‑Lite TTS |
|---|---|---|
| Google AI Studio (오디오 플레이그라운드) | ✅ | ✅ |
| Gemini API (개발자용) | ✅ | ✅ |
| Gemini Enterprise (엔터프라이즈 API) | 출시 예정 | 출시 예정 |
| Gemini Notebook (소비자용) | ✅ | ✅ |
| Google Vids (소비자용 비디오 도구) | ✅ | ✅ |
파트너 통합에는 Agora, LiveKit, Pipecat, Vercel, Figma, HeyGen, Linguana, Wondercraft, 99.co, Ollang이 포함되어 더빙, 현지화된 미디어 및 대화형 에이전트의 신속한 배포를 지원합니다.
Hacker News의 커뮤니티 반응
- 정렬(Alignment) 우려: 사용자들은 소비자, 프로슈머, 클라우드 플랫폼 간의 기능 세트가 일관되지 않아 어떤 기능이 보편적으로 사용 가능한지 불분명하다고 지적합니다. (Comment by @rcr‑anti)
- 음성 복제 수용: 동의 확인 및 워터마킹의 존재는 Google이 그동안 많은 제공업체가 보류해 왔던 음성 복제 기능을 출시할 준비가 되었다고 느끼는 신호로 해석됩니다. (Comment by @simonw)
- 제어와 품질의 트레이드오프: 여러 댓글 작성자는 스크립트 오디오에 대한 세밀한 대사 단위 제어 기능을 높이 평가하는 반면, 생성된 음성이 여전히 인간의 미묘한 표현력은 부족하다고 관찰합니다. (Comments by @Multicomp, @AyanamiKaine)
- 비용 및 가격 불투명성: 사용자들은 가격 정보가 누락되었고 음성 복제에 대한 지역적 제한이 있다는 점을 보고하며, 더 명확한 문서화가 필요한 출시 과정임을 시사합니다. (Comment by @nater5000)
- 비교 성능: 초기 사용자들은 Flash TTS가 표현력 면에서 ElevenLabs v3와 대등하거나 그 이상이며, 호출당 비용이 낮음(< $0.01)을 보고합니다. (Comment by @ttul)
- 오픈 소스 대안: 일부 참가자들은 로컬에서 실행되는 모델에 대해 질문하며, 클라우드 의존성 없이 실행할 수 있는 경량 TTS 솔루션의 틈새시장을 강조합니다. (Comment by @Thaxll)
Gemini 3.8 TTS를 사용해 보는 실용적인 단계
https://aistudio.google.com/generate-speech?model=gemini-3.8-flash-tts에서 Google AI Studio를 엽니다.- 라이브러리에서 기본 음성을 선택하거나 Voice Design 프롬프트를 시작합니다(예: “미국 남부 억양을 가진 카리스마 넘치는 내레이터를 만들어줘”).
- 선택적으로 30초 분량의 동의 샘플을 업로드하여 특정 음성을 복제합니다.
- 듀얼 화자 시나리오 편집기를 사용하여 무대 지시어(
<laughs>,<sigh>)를 추가하고 오디오를 생성합니다. - 결과를 내보내거나 프로그래밍 방식의 통합을 위해 Gemini API를 호출합니다.
전망
Gemini 3.8 Flash 및 Flash‑Lite TTS는 UI, API 및 엔터프라이즈 플랫폼을 통해 액세스할 수 있는 완전한 기능을 갖춘 오디오 스튜디오를 향한 중요한 발걸음을 의미합니다. 벤치마크에서의 리더십, 광범위한 언어 지원, 내장된 안전 메커니즘은 이전 TTS 출시를 늦췄던 많은 우려 사항을 해결합니다. 그러나 플랫폼 일관성, 가격 투명성, 지역적 가용성에 대한 커뮤니티의 피드백은 Google의 출시 과정이 원활하고 전 세계적인 채택을 달성하기 위해 지속적인 개선이 필요함을 시사합니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch