Gemini 3.5 Transcribe リリースノート

Gemini 3.5 Transcribe はインテリジェントでリアルタイムな音声文字起こしを提供します

Google は、生の音声を洗練されたフォーマット済みのテキストに変換するために設計された音声文字起こし(STT)モデル、Gemini 3.5 Transcribe をリリースしました。このモデルは、フィラーワード(「えーと」や「あのー」など)を自動的に削除し、言い直し(例:「火曜日に会いましょう——いいえ、水曜日に」)を処理し、単なる逐次的な発話ではなくユーザーの意図を捉えるように出力を自動フォーマットすることで、従来の音声認識とは一線を画しています。

API の利用可能性と実装

Gemini 3.5 Transcribe は、異なるアーキテクチャのニーズをサポートするために、2 つの異なる API を通じて開発者に提供されます:

  • リアルタイム・ストリーミング (gemini-3.5-transcribe-live): Live API を介してアクセス可能で、このバージョンはインタラクティブな音声アプリケーション向けに、サブ秒単位のレイテンシで双方向ストリーミングを提供します。
  • 録音済み音声の処理 (gemini-3.5-transcribe): Interactions API を介してアクセス可能で、このバージョンは録音された音声、会議のログ、通話記録を処理し、最大 3 人の話し手による話者分離(speaker attribution)と単語レベルのタイムスタンプを提供します。

開発者は、Google AI Studio および Gemini Enterprise Agent Platform で Gemini API を介してこれらのモデルにアクセスできます。

技術的パフォーマンスとベンチマーク

Gemini 3.5 Transcribe は、前身である Chirp 3 と比較して、特にレイテンシと精度において大幅な改善を示しています:

  • 単語誤り率 (WER): Artificial Analysis によると、このモデルはストリーミングで使用する場合に平均 4.0%、非ストリーミングで使用する場合に平均 2.6% の WER を達成しています。FLEURS ベンチマークでは、ストリーミングモードで 5.50%、非ストリーミングモードで 5.04% の WER を達成しています。
  • レイテンシ: 最終的な文字起こしまでの時間は、Chirp 3 と比較して 70% 改善されました。
  • 言語サポート: このモデルは、地域的なアクセントや多様な方言を含む 85 以上の言語を自動的に検出し、文字起こしします。
  • カスタマイズ: 特殊な専門用語や独自の綴りを認識するために、カスタム語彙をサポートしています。

Google エコシステム全体での統合

Google は、このモデルをいくつかの消費者向けおよび開発者向けサービスに統合しています:

  • Gboard (Android): 「Rambler」機能は 3.5 Transcribe を使用して、話された思考をフォーマット済みのテキストに変換し、音声ベースの編集やスタイルの変更を可能にします。
  • Gemini App (macOS): 自然な音声文字起こしと、画面のコンテキストをペアリングしてローカルファイルを要約したり画像を生成したりするための音声コマンドを可能にします。
  • Google Antigravity: 画面のコンテキストとチャット履歴を組み合わせて、ファイル名やアクティブなドキュメントの文字起こし精度を向上させます。
  • Chrome: 近日公開予定の機能により、ユーザーはあらゆるウェブ・フィールドで「話して入力」ができるようになります。

コミュニティ・フィードバックと技術的批判

公式リリースではパフォーマンスの向上を強調していますが、Hacker News での開発者やユーザーの議論では、いくつかの論争点や技術的なギャップが明らかになっています:

精度 vs. 「スマート」な編集

一部のユーザーは、言い淀み(disfluencies)を削除する「スマート文字起こし」機能が、意図せず的に意味のあるコンテキストを削除してしまうことがあると報告しています。あるユーザーは、「I hesitated to check it」のようなフレーズが削除され、文の意図された意味が変更されてしまったと指摘しています。

話者分離 (Diarization) とレイテンシ

批判的な意見を持つ人々は、話者分離が 3 人までの話し手(それ以上は実験的)に制限されていることを指摘しており、これは Soniox や Deepgram のような競合他社に遅れをとっています。さらに、一部の開発者は、精度は高いものの、リアルタイム翻訳アプリ向けにはレイテンシがまだ改善の余ようがあると主張しています。

信頼性とハルシネーション

ユーザーは、モデルが Chirp からハルシネーション(幻覚)の問題を継承しているかどうかについて懸念を察しています。ある開発者は、Chirp がノイズや無音状態のときに、繰り返しとなるテキスト(例:「I don't know. I don't know.」)を生成してしまうことがあったと述べ、その結果、タイムスタンプ用には Whisper を、修正用には Gemini Flash を使用するというハイブリッド・アプローチを用いていると述べています。

価格設定とアクセシビリティ

コミュニティ・メンバーは、発表において価格設定が透明でないことを強調しました。API ドキュメントに基づくと、コストは以下の通りです:

Model Input Cost Output Cost
3.5 Transcribe Live $3.50 / 1M tokens (or $0.005/min audio) $21.00 / 1M tokens (or $0.004/min text)
3.5 Transcribe $2.00 / 1M tokens (or $0.003/min audio) $12.00 / 1M tokens (or $0.002/min text)

ツールキットとワークフロー

一部の開発者は、Google Cloud ビリング・アカウントの処理時間をめぐぐって摩擦が生じていると報告しており、セットアップが OpenRouter のような競合他社よりも大幅に長くかかる可能性があると指摘しています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch