Gemini 3.8 Flash TTSとFlash-Lite TTSのリリース

TL;DR

Google DeepMind が Gemini 3.8 Flash TTS と Gemini 3.8 Flash‑Lite TTS をリリースしました。これらは、クリエイターがカスタムで表現力豊かな声を生成し、行ごとのパフォーマンスを直接制御できる新しいテキスト・トゥ・スピーチモデルであり、エンタープライズ用途向けに高スケールかつコスト効率の高い拡張性を提供します。

Gemini 3.8 Flash TTS: Creative Voice Studio

  • 目的: 深いクリエイティブな方向性とキャラクター設計に特化。
  • 機能: 自然言語のプロンプトから完全に新しい声を生成でき、演技の合図、ペーシング、方言の変化、バックチャネリングを制御可能。
  • 利用シーン: ゲーム、没入型オーディオブック、ポッドキャスト、インタラクティブメディア、および個別に設計されたキャラクター声が必要なすべての状況。
  • 声のライブラリ: 100以上の言語および方言(メキシコスペイン語、ケベックフランス語、スコットランド英語など地域変種を含む)をカバーする2,000以上ものプロダクション準備完了の声にアクセス可能。
  • 声の複製: 30秒のサンプルから一貫したボーカルプロファイルを作成でき、同意確認、SynthIDウォーターマーキング、C2PA資格証明を内蔵して声優の権利を保護。
  • 今後の機能 – 声のリミックス: プロンプトによる既存ライブラリの声のトーン、ピッチ、ペース、アクセントの微調整が可能になる予定。

Gemini 3.8 Flash‑Lite TTS: スケーラブルな高ボリューム生成

  • 目的: 高ボリュームのダブリング、オーディオコンテンツ作成、表現力豊かなボイスエージェントに最適化。
  • 効率性: トーン、ペーシング、ニュアンスに対する細かい制御を実現しつつ、コストとレイテンシを最小限に抑える。
  • 対象シナリオ: 大規模なメディアローカライゼーション、ボイスアシスタントの展開、および迅速かつ信頼性の高い音声合成が必要なすべてのアプリケーション。

精密な行ごとのパフォーマンス制御

  • ステージ・ディレクション: ユーザーは明示的なスクリプト・キューや自然言語による指示を各行に記述可能、またはGeminiが自然言語指示を解釈して自動的に処理。
  • 長文生成: 数時間にわたる連続音声でも高品質な声と最小限の話者変化を維持し、ポッドキャストやオーディオブックに最適。
  • 2人対話シーンのステージング: 会話中心のコンテンツ向けに、ネイティブなマルチターン会話と明確な声の分離をサポート。
  • ボーカル・バーストとバックチャネリング: 非言語的合図(例: <laughs>、<sigh>)や受動的聴取の反応(|mhm|、|yeah|)の挿入が可能で、現実的な会話の質感を再現。

ベンチマーク性能とグローバル品質

  • Hume AI Voice Design Benchmark: Gemini 3.8 Flash TTS は総合1位(スコア71.4)を獲得し、アクセントモデル化でも1位(スコア60.8)。
  • 総合品質指数: Flash TTS が1位、Flash‑Lite TTS が2位。
  • 人間の好み評価(Voice Arena): 日本語、ブラジルポルトガル語、ベトナム語、モダン標準アラビア語、メキシコスペイン語、ヒンディー語など主要言語において、両モデルがトップの評価を獲得。
  • 多言語対応: 100以上の言語をサポートし、高品質な音声体験を世界中で展開可能。

信頼性、同意、透明性のセーフガード

  • 同意確認: 声の複製には、参照声の所有者から取得した音声による同意記録が必要で、参照声と一致する必要がある。
  • 合成ウォーターマーキング: すべての音声出力に人間には感知できないSynthIDウォーターマーキングが埋め込まれており、AI生成音声の検出を可能にし、誤情報の防止に貢献。
  • モデルカード: Gemini 3.8 Audio モデルカードに、詳細な安全と責任に関する情報が掲載されている。

アクセスと統合オプション

  • Google AI Studio Playground: 音声生成ワークスペースを通じて、即座に体験可能。声の設計、複製、2人対話のスクリプト編集をサポート。
  • Gemini API: Agora、LiveKit、Pipecat、Vercel などのプラットフォームと統合可能で、高性能な音声インターフェースの構築を可能にする。
  • エンタープライズ展開: Flash TTS は Gemini Enterprise API を通じて提供予定。Flash‑Lite TTS は Google Vids を通じてエンドユーザーに提供される予定。
  • パートナーデプロイ: Figma、HeyGen、Linguana、Wondercraft、99.co、Ollang などが早期導入しており、ダブリング、地域アクセントのローカライゼーション、会話型エージェントに活用。

スタートガイド

  • 開発者: Gemini API と Google AI Studio を通じて両モデルにアクセス可能。
  • エンタープライズ: Gemini Enterprise API を通じて近日中に利用可能予定。
  • 一般ユーザー: Flash TTS は Gemini Notebook に、Flash‑Lite TTS は Google Vids に提供予定。

すべての情報は 2026年9月23日付の DeepMind ブログ投稿から直接引用。

Sources