OpenAI GPT‑Live‑1 API release

TL;DR

OpenAIは、APIにおいてGPT‑Live‑1を発表しました。これは、聞き取りと発話の同時実行が可能なフルデュプレックス(全二重)音声モデルであり、音声対応アプリケーションにおける割り込み処理、レイテンシ、および会話の自然さを劇的に向上させます。


What GPT‑Live‑1 Is

GPT‑Live‑1は、自動音声認識(ASR)、推論、およびテキスト読み上げ(TTS)を一つの統合されたアーキテクチャで実行する単一のモデルです。ChatGPTで初めて実演され、現在はOpenAI APIを通じて開発者が利用可能です。

主な機能は以下の通りです:

  • Simultaneous listening and speaking – モデルは出力を生成しながら入力音声を処理するため、個別のSTT‑LLM‑TTSパイプラインを必要としません。
  • Smooth interruption handling – 入力と出力の音声を同時に推論するため、ターンベースのシステムと比較して割り込みを最大80%削減できます(Speakによる初期評価に基づく)。
  • Delegation to backend models – より深い推論やツール呼び出しは、GPT‑6 Astraやサードパーティモデルなどのテキストモデルにオフロードできます。
  • Customizable tone, pace, and style – 開発者はシステムプロンプトを通じて、エージェントの音声特性を制御できます。
  • Robust background‑noise management – モデルは、会話の流れを止めることなく、静寂や周囲の音を区別します。
  • Long‑session reliability – 長時間のインタラクションにおいてコンテキストを保持し、会話の質を向上させます。
  • Telephony support – 予約やカスタマーサポートのような電話ベースのユースケースにおけるフルデュプレックス・エージェントを可能にします。

Architectural Simplification and Latency Reduction

従来の音声エージェントは、音声からテキストへの変換、推論、およびテキストから音声への変換という個別のコンポーネントを繋ぎ合わせていました。各受け渡し(handoff)はレイテンシを加え、特にユーザーが割り込みを入れたり、一時停止したりする場合に障害点となります。

GPT‑Live‑1は、このスタックを単一のモデルに集約し、以下の処理を行います:

  1. ASR transcription – ユーザーの音声のリアルタイム・テキスト化を提供します。
  2. Turn detection – ターンベースではない設定においても、ユーザーが話し終えたタイミングを認識します。
  3. Response generation – 割り込みを検知しながら、音声を生成します。
  4. Tool delegation – 複雑なクエリをバックエンド・モデル(例:高ボリュームタスク用のLuna、ニュアンスのある推論用のAstra)に転送します。

バックグラウンドで推論が行われている間も会話を継続させることで、開発者はエンドツーエンドのレイテンシを低減し、より自然なリズムを実現できます。


Measured Full‑Duplex Advantages

OpenAIの内部評価では、GPT‑Live‑1において大幅な獲得が見られます:

  • Full Duplex Bench のパフォーマンスは、GPT‑Realtime‑2.1と比較して30パーセントポイント向上し、ターン交代のレイテンシが顕著に減少しました。
  • GPT‑6 Astra (medium reasoning effort) と組み合わせた場合、GPT‑Live‑1は、エンドツーエンドのタスクにおける最先端の音声エージェントの知能を測定する Tau3 メトリックにおいて第1位を獲得しました。
  • 航空、小売、通信、銀行の音声カスタマーサービス・ベンチマークにおいて、タスク成功率、割り込み処理、およびツール使用の正確性に関する Pass@1 スコアが向上しました。

これらの結果は、統合されたフルデュプレックス・アーキテクチャが、速度とタスク成功率の両面で、既存の最高のモジュール式パイプラインを凌駕することを示しています。


New Voice Options and Language Coverage

GPT‑Live‑1は、以前に提供されていた限定的なリアルタイム音声のセットを超えて拡張されています。開発者は、より幅広いアクセント、方言、言語に対応しており、オーストラリア英語の影響を受けた音声から開始します。OpenAIは、今後数ヶ月間で音声とサポートされる言語をさらに追加していく予定です。


Pricing and Availability

  • Front‑end voice layer: $0.05 per minute.
  • このモデルは本日、APIを通じて利用可能です。開発者は、コストとパフォーマンスの要件に合わせて、任意のバックエンド・モデルやツール・ハーネスを組み合わせることができます。
  • カスタム音声へのアクセスおよびエンタープライズ・グレードのデージェン・プロイメンテーションは、営業担当者への連絡、または、GPT‑Live‑1を活用してエンタープライズ環境での信頼できるリアルタイム・ボイス・インタラクションを実現する OpenAI Presence を通じて提供されます。

How Developers Can Use GPT‑Live‑1

  1. Start a session – APIを呼び出し、自然に話し、騒音のある環境(例:コーヒーショップ、街路)で割り込み処理を検知・テストします。
  2. Shape the agent – システムプロンプトを設定して、トーン、ペース、会話スタイルをフレームワーク化します。
  3. Delegate reasoning – 複雑なクエリやツール呼び出しのために、バックエンド・モデル(例:GPT‑6 Astra)を構成します。
  4. Integrate with existing workflows – 提供されるASRトランスクリプトとレスポンス・テキストを使用して、ロギング、分析、またはダウンストリーム・プロセッシングを行ってください。

Customer Feedback Snapshot

早期導入者からは、GPT‑Live‑1の割り込み処理により、学習者がチューターが応答する前に考える時間をより多く確保できることが報告されており、従来のターンベースのシステムと比較して割り込みを約80%削減しています。


Takeaway

GPT‑Live‑1のリリースは、断片化された音声パイプラインから、低レイテンシ、優れた割り込み処理、および豊かなカスタマイズ性を実現する統合されたフルデュプレックス・モデルへの転換を意味します。これにより、消費者向けおよびエンタープライズ向けの両方のドメインにおいて、自然な音声ファースト・アプリケーションのアプリケーションの可能性を可能性を拓きます。

Sources