Gemini 3.1 Flash TTS リリースノート / 新機能

Gemini 3.1 Flash TTS リリースノート / 新機能

Google DeepMind は、より高い表現力、改善された自然さ、および細かい制御性を目的とした次世代テキスト読み上げ(TTS)モデルである Gemini 3.1 Flash TTS を発表しました。このモデルは、開発者向けに Gemini API と Google AI Studio を通じてプレビュー版として提供され、企業向けには Vertex AI を介して、Workspace ユーザー向けには Google Vids を介して利用可能になりました。

高品質な音声品質とパフォーマンス

Gemini 3.1 Flash TTS は、現在のところ Google が提供する最も自然で表現力豊かなテキスト読み上げモデルとして位置付けられています。ブラインドヒューマンプリファレンステストを利用した Artificial Analysis TTS リーダーボードによれば、このモデルは Elo スコア 1,211 を達成しました。

Artificial Analysis はさらに、Gemini 3.1 Flash TTS を「最も魅力的な quadrant」に分類しています。これは、高品質な音声生成と低い運用コストの最適なバランスを挙げています。主な機能には、ネイティブなマルチスピーカー対話と 70 以上の言語サポートが含まれます。

自然言語オーディオタグによる細かい制御

Gemini 3.1 Flash TTS の特徴的な機能は、オーディオタグの導入です。これにより、ユーザーはテキスト入力に自然言語コマンドを直接埋め込み、AI 音声の vocal style(声のスタイル)、ペース、および配信を制御できます。

To provide developers with a "director's chair" experience, Google AI Studio includes several configurable controls:

  • シーンディレクション: ユーザーは環境を定義し、キャラクターが一貫性を保ち、会話の複数のターンにわたって自然に反応するように対話の指示を提供できます。
  • スピーカーレベルの特異性: 開発者はキャラクターに固有のオーディオプロファイルを割り当て、「ディレクターノート」を使用してトーン、アクセント、ペースを調整できます。インラインタグにより、スピーカーは文中で表現を変更することができます。
  • シームレスエクスポート: スタジオでボーカルパフォーマンスが最終確定された後、パラメータは Gemini API コードとしてエクスポートでき、異なるプラットフォームやプロジェクト間で音声の一貫性を維持できます。

グローバルなスケーラビリティと言語サポート

Gemini 3.1 Flash TTS はグローバル展開に最適化されており、70 以上の言語をサポートしています。これにより、開発者は主要な国際市場で高度なスタイル、アクセント、ペース制御を実装でき、ローカライズされた表現豊かな音声体験を大規模に作成できるようになります。

AI セーフティと SynthID ウォーターマーク

誤情報を撲滅し、AI 生成コンテンツの信頼性の高い検出を確保するため、Gemini 3.1 Flash TTS によって生成されるすべての音声は SynthID を使用してウォーターマークが付けられます。このウォーターマークは人間の耳には感知できませんが、検証のために音声出力に直接組み込まれています。

Sources