Google Gemini 3.8 FlashおよびFlash‑Lite TTSの発表:表現力豊かでスケーラブルな音声生成
Gemini 3.8 FlashおよびFlash‑Lite TTSが、表現力豊かでスケーラブルな音声生成の基準を引き上げる
Googleは2026年9月23日、Gemini 3.8 Flash TTSおよびGemini 3.8 Flash‑Lite TTSを発表し、Geminiファミリーの中で最も表現力豊かな音声生成モデルとして位置づけました。これらのモデルにより、開発者はカスタムキャラクターの音声を作成したり、30秒のサンプルから既存の音声を複製したり、行ごとに読み上げを制御したりすることが可能になり、同時に大量かつコスト効率の高いユースケースをサポートします。
すぐに使えるコア機能
Flash TTSは、深い創造的な制御に焦点を当てています。 ユーザーは自然言語のプロンプトを使用して全く新しい音声を設計し、アクセント、方言、ペース、相槌の合図を指定できるほか、数時間の音声にわたって話者のブレを生じさせることなく、複数話者のシーンを生成できます。
Flash‑Lite TTSは、スケーラビリティをターゲットにしています。 このモデルは大量の吹き替えや音声エージェント向けに最適化されており、より低コストで同じきめ細やかなトーンとペースの制御を提供します。
両モデルとも以下をサポートしています:
- 100以上の言語と地域バリエーション(例:メキシコスペイン語、ケベックフランス語、スコットランド英語)をカバーする2,000以上の実用的な音声。
- 同意を得た30秒のサンプルからの音声複製。SynthID透かしとC2PA認証が組み込まれています。
<laughs>、<sigh>、相槌トークン(|mhm|、|yeah|)などの直接的なスクリプトキュー。- 数時間のコンテンツにわたって音色を維持する長尺生成。
ベンチマーク性能が「最も表現力豊か」という主張を裏付ける
GoogleはHume AIのVoice Design Benchmarkを引用しており、Gemini 3.8 Flash TTSは71.4(総合ランク1位)を記録し、アクセントモデリングでは60.8を記録して、前モデルのGemini 3.1 Flash TTSを上回りました。同ベンチマークでは、Flash‑Lite TTSも総合品質で2位にランクインしています。Voice Arenaでの人間による選好テストでも、両モデルは日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語、メキシコスペイン語、ヒンディー語を含むいくつかのグローバル言語でトップにランクされています。
信頼、同意、透かしがパイプラインに組み込まれている
音声複製には、参照話者と一致する音声による同意録音が必要です。同意音声は検証目的でのみ保存され、モデルのトレーニングには使用されません。生成されたすべてのクリップには目に見えないSynthID透かしが含まれており、AI生成音声の事後検出を可能にし、誤情報の緩和に役立ちます。
GoogleのAIエコシステム全体での利用可能性
| プラットフォーム | Flash TTS | Flash‑Lite TTS |
|---|---|---|
| Google AI Studio (オーディオプレイグラウンド) | ✅ | ✅ |
| Gemini API (開発者向け) | ✅ | ✅ |
| Gemini Enterprise (エンタープライズAPI) | 近日公開 | 近日公開 |
| Gemini Notebook (コンシューマー向け) | ✅ | ✅ |
| Google Vids (コンシューマー向け動画ツール) | ✅ | ✅ |
パートナー統合には、Agora、LiveKit、Pipecat、Vercel、Figma、HeyGen、Linguana、Wondercraft、99.co、Ollangが含まれており、吹き替え、ローカライズされたメディア、会話型エージェントの迅速な展開を可能にします。
Hacker Newsでのコミュニティの反応
- 整合性に関する懸念: ユーザーは、コンシューマー、プロシューマー、クラウドプラットフォーム間で機能セットが一貫しておらず、どの機能が普遍的に利用可能かが不明確であると指摘しています。(@rcr‑antiによるコメント)
- 音声クローニングの受容: 同意検証と透かしの存在は、Googleがこれまで多くのプロバイダーが控えていた音声複製という機能をリリースすることに自信を持っている兆候と見なされています。(@simonwによるコメント)
- 制御と品質のトレードオフ: 多くのコメント投稿者は、スクリプト化された音声に対するきめ細かな行ごとの制御を評価する一方で、生成された音声には依然として人間の発話のような繊細さが欠けていると指摘しています。(@Multicomp、@AyanamiKaineによるコメント)
- コストと価格の不透明さ: ユーザーは価格情報の欠如や音声複製に関する地域制限を報告しており、より明確なドキュメントが必要なロールアウトであることを示唆しています。(@nater5000によるコメント)
- 比較パフォーマンス: 初期の導入者は、Flash TTSが表現力においてElevenLabs v3と同等かそれ以上であり、呼び出しあたりのコストが低い($0.01未満)と報告しています。(@ttulによるコメント)
- オープンソースの代替案: 一部の参加者はローカルで実行可能なモデルについて質問しており、クラウド依存なしで実行できる軽量なTTSソリューションのニッチな需要を強調しています。(@Thaxllによるコメント)
Gemini 3.8 TTSを試すための実践的なステップ
https://aistudio.google.com/generate-speech?model=gemini-3.8-flash-ttsにある Google AI Studio を開きます。- ライブラリから基本音声を選択するか、Voice Design プロンプトを開始します(例:「南部アメリカ訛りのカリスマ的なナレーターを作成して」)。
- オプションで、特定の音声を複製するために30秒の同意サンプルをアップロードします。
- デュアルスピーカーの脚本エディタを使用して、ト書き(
<laughs>、<sigh>)を追加し、音声を生成します。 - 結果をエクスポートするか、プログラムによる統合のために Gemini API を呼び出します。
今後の展望
Gemini 3.8 FlashおよびFlash‑Lite TTSは、UI、API、エンタープライズプラットフォームを通じてアクセス可能な、フル機能のオーディオスタジオに向けた重要な一歩を表しています。ベンチマークにおけるリーダーシップ、広範な言語カバレッジ、組み込みの安全メカニズムは、これまでのTTSの普及を遅らせていた多くの懸念に対処するものです。しかし、プラットフォームの一貫性、価格の透明性、地域の可用性に関するコミュニティのフィードバックは、Googleのロールアウトがシームレスでグローバルな採用を達成するために継続的な改善を必要とすることを示唆しています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch