Introducing GPT‑Live‑1 and GPT‑Live‑1 mini: OpenAI’s New Full‑Duplex Voice Models

Introducing GPT‑Live‑1 and GPT‑Live‑1 mini: OpenAI’s New Full‑Duplex Voice Models

TL;DR

OpenAI は GPT‑Live‑1 と GPT‑Live‑1 mini を発表しました。これらはフルデュプレックスアーキテクチャを採用し、同時に聞き取りと発話が可能で、重い推論は GPT‑5.5 に委任し、より自然な ChatGPT Voice 体験を提供します。

Overview

We’re launching GPT‑Live, a new generation of voice models that make talking with AI feel much more like having a real conversation.

GPT‑Live はフルデュプレックスアーキテクチャ上に構築されており、同時に聞き取りと発話ができます。"mhmm" や "yeah" といった相槌で注意を示したり、素早いやり取りを行ったり、ユーザーが考える時間が必要なときは黙って待つことができます。

リリース時点では、ウェブ検索や高度な推論、複雑な作業が必要なタスクはバックグラウンドで GPT‑5.5 が担当し、会話の流れは途切れません。

本日リリースされるのは GPT‑Live‑1GPT‑Live‑1 mini の 2 つのバージョンで、近日中に API でも利用できるようになる予定です。

Technical Architecture

GPT‑Live addresses these limitations through two architectural changes.

Continuous interaction via full‑duplex – Instead of processing discrete turns, GPT‑Live continuously processes input while generating output, enabling it to decide many times per second whether to speak, listen, pause, interrupt, or invoke a tool. This supports natural back‑and‑forth, better timing awareness, and live translation.

Delegation for deeper work – The interaction layer (GPT‑Live) is decoupled from a separate model that handles search, reasoning, or agentic tasks. When a question needs such capabilities, GPT‑Live delegates to a frontier model like GPT‑5.5, maintains the conversation, and returns the result when ready. This design also lets GPT‑Live continuously use the latest frontier models as they are released.

Capabilities and User Experience

Over time, we believe this research will also unlock the ability to use voice for increasingly complex, longer‑running, and more agentic work.

  • ユーザーは途中で割り込んだり、一時停止したり、ChatGPT に速度を落としてほしいと依頼できます。モデルは "mhmm" や "got it" といったフレーズで応答します。
  • GPT‑Live 用に 9 種類の音声がリマスターされています。
  • 発話中に、ChatGPT は天気、株価、スポーツなどのトピックに対してリッチなビジュアルカードを表示できます。
  • 音声は検索、メモリ、画像、ファイルアップロードを引き続きサポートします。
  • 推論レベルを選択可能です:Instant(高速応答)か、Medium/High(より考慮時間が必要)を選べます。

Evaluation

We built new human evaluations to measure pleasantness and the flow of conversation.

5〜10 分間のヘッドツーヘッド会話において、GPT‑Live‑1 と GPT‑Live‑1 mini は Advanced Voice Mode に対し、全体的な好み、ターンテイキング、割り込み、会話の流れ、自然さのすべてで強く好まれました。

ソースで言及された具体的なベンチマーク結果:

  • GPQA: GPT‑Live‑1 は生物学、化学、物理学の専門レベルの科学的推論で Advanced Voice Mode を大きく上回ります。
  • BrowseComp: GPT‑Live‑1 はエージェント的ウェブ検索や入手困難な情報の取得で Advanced Voice Mode に対し大幅な改善を示します。
  • τ³‑Voice Telecom (internal variant): GPT‑Live‑1 は現実的なマルチターンの通信サポートタスクで Advanced Voice Mode を上回ります。

Safety

GPT‑Live was designed to be safe by default.

安全対策は以下を含みます:

  • 自己傷害、精神病・躁状態、AI への感情的依存、暴力、性的コンテンツに焦点を当てた新しい音声ネイティブ評価と合成評価を用いた拡張安全テスト。
  • 音声特有のリスクに対する社内レッドチーミング。
  • リアルタイムのセーフガードにより、モデルを安全な応答へ誘導したり、安全メッセージを表示したり、リスクが高いケースでは会話を終了したりできます。
  • 自己傷害に対する支援フローを適応させ、専門家が検証した危機ホットラインを提供。
  • ティーン向けに不適切な応答を減らすため、年齢に応じた行動をモデルに直接組み込み。保護者はティーン向けの ChatGPT Voice を有効化/無効化でき、リスクが高い状況で通知を受け取れます。
  • 感情的依存に焦点を当てた長期的測定とリリース後モニタリングを継続。
  • 実在する人物の声を偽装しないよう、事前に定義された音声セットとセーフガードを使用。

ソースによれば、GPT‑Live はほぼすべての評価された安全領域で Advanced Voice Mode と同等かそれ以上のパフォーマンスを示しています。

Rollout and Availability

We’re beginning to roll out two versions of GPT‑Live – GPT‑Live‑1 and GPT‑Live‑1 mini – to ChatGPT users globally today.

  • GPT‑Live‑1 は Go、Plus、Pro ユーザー向けの ChatGPT Voice のデフォルトモデルになります。
  • GPT‑Live‑1 mini は Free ユーザーのデフォルトになります。
  • ロールアウトは iOS、Android、ChatGPT.com を対象としています。
  • 開発者や企業は提供されたフォームから API で利用可能になる際の通知を受け取ることができます。
  • 従来の ChatGPT Voice(Standard と Advanced Voice Mode)は、音声とビデオや画面共有が必要な機能がある場合に引き続き利用可能です。

Limitations and Future Work

At launch, GPT‑Live will not support voice with video or screen sharing in ChatGPT, but we’re working to introduce these capabilities soon.

  • 一部の言語では、モデルが非ネイティブアクセントを持ったり、流暢さにギャップがあったりします。改善は継続中です。
  • 将来的には、音声を用いた本当に自然なヒューマン‑AI インタラクションを実現し、時間が長く、複雑で、エージェント的な作業へと拡張していくことがビジョンです。

上記の記述はすべてソースから直接引用したもので、外部の事実や数値は追加していません。


SUMMARY: OpenAI は GPT‑Live‑1 と GPT‑Live‑1 mini を発表しました。これらはフルデュプレックス音声モデルで、自然で割り込み可能な会話を実現し、複雑な推論は GPT‑5.5 に委任、全世界の ChatGPT ユーザーへ順次展開されます。

TITLE: Introducing GPT‑Live‑1 and GPT‑Live‑1 mini: OpenAI’s New Full‑Duplex Voice Models

Sources