OpenAI Voice Engine: 技術実装と安全フレームワーク

技術的展開と製品統合

Voice Engine は、2023 年 9 月以降、3 つの主要な製品実装で活用されています:

  • ChatGPT Voice Mode: 2023 年 9 月に開始されたこの機能は、2023 年 5 月から始まったプロの声優、タレントエージェンシー、業界アドバイザーを巻き込んだプロセスで慎重に選定された実際の声のみを使用して作成された音声を利用しています。
  • TTS API: 2023 年 11 月にリリースされたこの API は、6 つのプリセット音声を提供します。各音声は、プロの声優からの 15 秒の音声サンプルを使用して作成されました。
  • Custom Voice Previews: 2024 年 3 月に、OpenAI は信頼できるパートナーの小規模なセットと共にカスタム音声を作成する機能をプレビューし、合成音声技術のリスクと機会を探求しました。

安全性研究と政策目標

OpenAI は、合成音声のリスクを政策立案者や一般市民に理解させるために、反復的な展開フレームワークを活用しています。2022 年後半に開発された初期の内部プロトタイプ(内部テストのみで公開・非公開の音声サンプルを混合使用)は、2023 年夏から世界の政策立案者に技術の可能性を示すために使用されました。

カスタム音声機能の限定的なパートナープレビューを通じて、OpenAI は以下のセキュリティおよび政策目標を達成することを目指しています:

  • 音声ベース認証の段階的廃止: 銀行口座などの機密情報へのアクセスにおけるセキュリティ手段としての音声への依存を減らすこと。
  • 個人の声の保護: AI における個人の声の使用を保護する政策の検討。
  • 公共教育: AI の能力と限界、特に欺瞞的コンテンツの可能性について一般市民に教育すること。
  • コンテンツの出所確認: AI 生成音声と実際の人間の音声を区別するために、視聴覚コンテンツの出所を追跡する技術の採用を加速すること。

内部テストと整合性

Voice Engine の内部プロトタイプは、ガードレールの開発に情報を提供するための整合性と安全性研究のみに専ら使用されました。OpenAI は、これらの初期内部テストの出力は内部テスト用に留められ、公開向け製品を支えるモデルの訓練には使用されなかったと明言しています。

Sources