OpenAI 次世代オーディオモデル API リリース

OpenAIは、よりインテリジェントでカスタマイズ可能な音声エージェントの開発を可能にするため、APIで新しいオーディオモデルのスイートを開始しました。これらのモデルは、最先端の音声認識精度と、初のステアラブルなテキスト音声合成機能を導入し、開発者が特定の指示に基づいてモデルの話し方を制御できるようにします。

強化された音声認識機能

OpenAIは gpt-4o-transcribegpt-4o-mini-transcribe を導入しました。これらは従来の Whisper モデルよりも精度と信頼性で優れています。これらのモデルは、話速の変化、騒がしい背景、多様なアクセントなど、挑戦的な音声環境に対応するよう特別に設計されています。

主な改善点は次のとおりです:

  • Reduced Word Error Rate (WER): 新しいモデルは、100言語以上をカバーする多言語 FLEURS ベンチマークを含む複数のベンチマークで、WER を低減しています。
  • Benchmark Performance: これらのモデルは、すべての言語評価において Whisper v2 と Whisper v3 を一貫して上回ります。
  • Use Case Optimization: 文字起こしの信頼性向上により、会議の議事録作成や顧客コールセンターで特に効果的です。

ステアラブルなテキスト音声合成

新しい gpt-4o-mini-tts モデルはステアラビリティを導入し、開発者が音声の話し方やトーンを指示できるようにします。開発者は初めて「同情的なカスタマーサービスエージェントのように話す」などの指示を提供し、声の感情的な共鳴やスタイルをカスタマイズできます。

この機能により、ストーリーテリングの表現的なナレーションや、共感的なカスタマーサービスのやり取りなど、さまざまなカスタマイズされたアプリケーションが可能になります。これらのモデルは現在、合成プリセットに合わせるために人工的で事前設定された声に限定されています。

技術的イノベーション

次世代のオーディオモデルは GPT-4o と GPT-4o-mini アーキテクチャ上に構築され、いくつかの主要な技術的進歩を活用しています:

事前学習とデータセット

  • Audio-Centric Pretraining: これらのモデルは、音声に特化した専門データセットで広範に事前学習され、性能を最適化し、音声のニュアンスに関する深い洞察を提供します。

蒸留手法

  • Advanced Distillation: OpenAI は高度な蒸留技術と自己対戦手法を使用し、より大きな音声モデルから小型で効率的なバージョンへ知識を転送しました。これにより、小型モデルでも高い会話品質と応答性を維持し、現実的なユーザー‑アシスタントのやり取りを再現します。

強化学習

  • RL-Heavy Paradigm: 音声認識モデルに対しては、強化学習中心のアプローチを統合し、文字起こし精度を最先端レベルに引き上げ、特に幻覚(hallucination)を減らし、複雑な認識シナリオでの精度を向上させました。

API の利用可能性と統合

これらのモデルは、音声認識(speech-to-text)および音声合成(text-to-speech)API を通じてすべての開発者に利用可能です。音声エージェントの開発を簡素化するため、OpenAI は Agents SDK との統合をリリースしました。低遅延の音声‑音声体験が必要な開発者には、Realtime API で利用できる音声‑音声モデルを推奨しています。

今後のロードマップ

OpenAI はオーディオモデルのインテリジェンスと精度の向上を継続する計画です。将来的な目標には、開発者が独自のカスタム音声を導入できる方法を模索しつつ、安全基準を維持することが含まれます。また、OpenAI はビデオを含む他のモダリティにも投資し、マルチモーダルなエージェント体験の創出を支援します。

Sources