Gemini 3.5 Transcribe リリースノート
Google DeepMindは、生の音声を直接、洗練されたフォーマット済みのテキストに変換するように設計された高精度な音声文字起こしモデル、Gemini 3.5 Transcribeを発表しました。このモデルは、背景ノイズ、複雑な専門用語、およびフィラー(「えーと」や「あの」などの言い淀み)や自己修正などの非流暢性を処理することで、以前のバージョンを改善し、リアルタイムの音声インタラクションに適したクリーンな文字起こしを実現します。
開発者向けアクセスとAPI実装
Gemini 3.5 Transcribeは、異なる開発者ワークフローをサポートするために、2つの異なるAPIを通じて提供されます:
- Real-time streaming (
gemini-3.5-transcribe-live): Live APIを介して提供されるこのバージョンは、インタラクティブな音声アプリケーション向けに、サブ秒単位のレイテンシで継続的かつ双方向のストリーミングを提供します。 - Pre-recorded audio processing (
gemini-3.5-transcribe): Interactions APIを介して提供されるこのバージョンは、録音された音声、会議、通話ログ向けに最適化されており、話者属性の付与や単語レベルのタイムスタンプ機能を備えています。
開発者は、Google AI StudioおよびGemini Enterprise Agent Platform内のGemini APIを通じて、これらのモデルにアクセスできます。
技術的能力とパフォーマンス
Gemini 3.5 Transcribeは、以前のChirp 3モデルと比較して、いくつかの「スマート文字起こし」機能とパフォーマンスの向上を導入しています:
文字起こしの精度とインテリジェンス
- Disfluency Cleanup (言い淀みの除去): モデルは、フィラー(例:「ums」や「ahs」)を自動的に削除し、自己修正(例:「火曜日に会いましょう—いいえ、水曜日に」)を処理します。
- Custom Vocabulary (カスタム語彙): モデルは、提供されたカスタム語彙リストを通じて、専門的な専門用語や独自の綴りに適応します。
- Multilingual Support (多言語サポート): 85以上の言語を自動的に検出し、さまざまな地域的なアクセントや方言を含む文字起こしを行います。
- Multi-speaker Identification (複数話者の識別): 録音された音声の場合、モデルは最大3名までの話者にタイムスタンプ付きで音声を割り当てます(3名を超える話者のサポートは現在実験的です)。
- Function Calling (関数呼び出し): Gemini macOS appにおいて、モデルは関数呼び出しを介して、ファイル分析や画像生成などの複雑なタスクを他のGeminiモデルに委任できます。
ベンチマークと精度
Artificial Analysisによって測定された結果、Gemini 3.5 Transcribeは、ストリーミング使用例で平均単語誤り率 (WER) 4.0%、非ストリーミング使用例で2.6%を達成しています。主要な言語とロケールにわたるFLEURSベンチマークでは、ストリーミングモードで5.50%のWER、非ストリーミングモードで5.04%のWERを達成しています。
Chirp 3と比較して、このモデルは最終的な文字起こしまでの時間を70%改善しています。
製品統合
Gemini 3.5 Transcribeは、文脈を考慮した音声インタラクションを可能にするために、いくつかのGoogle製品に統合されています:
- Gboard (Android): 「Rambler」機能は、モデルを使用して話された思考をフォーマット済みのテキストに変換し、音声による編集やスタイルの変更を可能にします。
- Google Antigravity: モデルは画面のコンテキストとチャット履歴を利用して、ファイル名やアクティブなドキュメントの文字起こし精度を高めます。
- Gemini app (macOS): 自然な音声文字起こしと、画面のコンテキストと組み合わせてローカルファイルを要約したり画像を生成したりする音声コマンドを可能にします。
- Google AI Studio: Build modeで、音声駆動型のアプリケーション開発(「vibe coding」)が可能です。
- Chrome: 近日公開予定。モデルは、あらゆるウェブフィールドで「talk to type」機能を実現します。
エコシステムへの採用
Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, および Vision Agentsを含む、いくつかの開発者プラットフォームが、音声駆動型のインターフェースのデプロイを促進するためにGemini Live APIを統合しています。さらに、Vivo, Intellitek Health, および Lingopalといった企業は、モデルのレイテンシと多言語サポートに関する良好な結果を報告しています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch