OpenAIがAPIでGPT-Realtime-2、GPT-Realtime-Translate、GPT-Realtime-Whisperを導入
概要
OpenAIはRealtime API向けに3つの音声モデル、GPT‑Realtime‑2、GPT‑Realtime‑Translate、GPT‑Realtime‑Whisperを発表しました。これらのモデルは、開発者がより自然に感じられ、よりインテリジェントに応答し、リアルタイムでアクションを取る音声体験を作成できるようにすることを目的としています。
GPT‑Realtime‑2 の機能
GPT‑Realtime‑2は、ライブ音声インタラクションにGPT‑5クラスの推論を追加します。開発者は推論の努力度を minimal、low、medium、high、xhigh から選択でき、デフォルトは low です。モデルは「let me check that」のような前置きで作業を示すことや、可聴フィードバック付きの並列ツール呼び出し、強化されたリカバリ動作、コンテキストウィンドウを32Kから128Kへ拡張、ドメイン固有用語の保持向上、トーンと配信の制御可能性をサポートします。
音声評価では、GPT‑Realtime‑2(high)はBig Bench Audioで音声インテリジェンスにおいてGPT‑Realtime‑1.5より15.2%高いスコアを獲得し、GPT‑Realtime‑2(xhigh)はAudio MultiChallengeで指示遵守において13.8%高いスコアを示しました。Zillowのベンチマークでは、プロンプト最適化により通話成功率が26ポイント向上しました(95% 対 69%。)
“GPT‑Realtime‑2の際立った点は、複雑な音声インタラクションにもたらすインテリジェンスとツール呼び出しの信頼性です。最も困難な敵対的ベンチマークにおいて、プロンプト最適化後に通話成功率が26ポイント向上しました(95% 対 69%)。GPT‑Realtime‑2は、当社のビジネスにとって重要な公平住宅コンプライアンスにおいても実質的により堅牢です。エージェント的能力とガードレールの強さの組み合わせが、Zillowでの本番音声利用を可能にしています。” — ジョシュ・ワイスバーグ、Zillow SVP兼AI部門長
GPT‑Realtime‑Translate の機能
GPT‑Realtime‑Translateは、70以上の入力言語から13の出力言語へのライブ音声翻訳を、話者の速度に合わせて提供します。顧客サポート、国境を越えた販売、教育、イベント、メディア、グローバルなオーディエンス向けのクリエイタープラットフォーム向けに設計されています。
ヒンディー語、タミル語、テルグ語での評価では、モデルは他のすべてのテスト済みモデルに比べてWord Error Rateが12.5%低く、フォールバック率も低く、タスク完了率が高く、自然な会話を維持できるレイテンシを実現しました。
“インド向けの音声AIを構築することは、多様な地域の音韻に対応することを意味します。ヒンディー語、タミル語、テルグ語での評価において、GPT‑Realtime‑Translateはテストした他のすべてのモデルに比べてWord Error Rateが12.5%低く、フォールバック率も低く、タスク完了率が高く、自然な会話を維持できるレイテンシを示しました。これは多言語音声AIの新たな標準を設定します。” — プラティーク・サチャン、BolnaAI 共同創業者兼CTO
GPT‑Realtime‑Whisper の機能
GPT‑Realtime‑Whisperは、話者が話すと同時に音声を文字起こしするストリーミング音声‑テキストモデルで、低レイテンシの字幕、ライブ会議メモ、音声エージェントの継続的な理解を可能にします。会議の字幕、教室の文字起こし、放送字幕、顧客サポート、医療、営業、採用、その他大量の音声インタラクションにおける迅速なフォローアップワークフローなどのユースケースをサポートします。
音声インタラクションパターン
開発者はこれらのモデルを3つの新興音声AIパターンに適用できます:
- Voice‑to‑action: ユーザーがニーズを説明すると、システムが推論し、ツールを使用してタスクを完了します(例:Zillowの住宅検索アシスタント)。
- Systems‑to‑voice: ソフトウェアがコンテキストをライブ音声ガイダンスに変換します(例:ゲート変更やルートを案内する旅行アプリ)。
- Voice‑to‑voice: AIがライブ会話を言語、タスク、変化するコンテキストを超えて継続できるよう支援します(例:Deutsche Telekomの多言語サポート)。
これらのパターンは組み合わせることができ、Pricelineは検索、変更処理、リアルタイム更新の提供、現地での会話翻訳を行う音声駆動型旅行マネージャーの開発に取り組んでいます。
安全性と使用
Realtime APIは、有害コンテンツガイドラインに違反するセッションを停止できるアクティブ分類器を組み込んでいます。開発者はAgents SDKを通じて追加のガードレールを設定できます。利用ポリシーでは、出力をスパム、欺瞞、その他有害な目的に再利用することを禁じており、コンテキスト上で明らかでない限り、開発者はAIとのやり取りを開示しなければなりません。
価格と利用可能性
GPT‑Realtime‑2は、1M音声入力トークンあたり32ドル(キャッシュされた入力トークンは0.40ドル)および1M音声出力トークンあたり64ドルで提供されます。GPT‑Realtime‑Translateは1分あたり0.034ドル、GPT‑Realtime‑Whisperは1分あたり0.017ドルです。3つのモデルはすべてRealtime APIで現在利用可能です。
開始方法
まず、提供されたCodexプロンプトを開いて、最小限のRealtime‑2 WebRTC音声エージェントを追加または拡張するか、まだインストールされていない場合はCodexアプリをダウンロードしてください。プロンプトには、サーバー側セッションエンドポイントの設定、RTCPeerConnectionを介したマイクと音声出力の接続、check_calendarなどのサンプルツールの登録手順が含まれています。