OpenAI Voice Engine: 合成音声の機能と安全フレームワーク

OpenAIはVoice Engineを導入しました。これはテキスト読み上げモデルで、15秒の音声サンプルだけで特定の話者に似た自然な音声を生成できます。この技術はアクセシビリティやグローバルなコミュニケーションに大きな可能性を示す一方で、OpenAIは合成音声の悪用リスクに対処するため、リリースを信頼できるパートナーの小規模なグループに限定しています。

Voice Engine の技術的能力

Voice Engineは最小限のデータから感情豊かでリアルな合成音声を作成できます。このモデルは15秒の音声サンプル1つとテキスト入力だけで、元の話者に非常に近い音声を生成します。

2022年後半に開発されたこの技術は、すでにOpenAIのテキスト読み上げAPIのプリセット音声や、ChatGPTのVoiceおよびRead Aloud機能を支えています。モデルの重要な技術的特徴は、翻訳時に元の話者の母国語アクセントを保持できる点です。例えば、フランス語話者の音声サンプルから英語を生成すると、フランス語アクセントの英語が出力されます。

初期の応用例とユースケース

OpenAIは現在、少数のパートナーと共にVoice Engineをテストし、さまざまな分野でインパクトの大きい応用を模索しています:

教育とアクセシビリティ

  • Reading Assistance: Age of Learningは、モデルを使用して事前にスクリプトされたボイスオーバーコンテンツやリアルタイムの個別応答を学生に提供し、標準のプリセットオプションよりも幅広い感情豊かな音声を実現しています。
  • Non-Verbal Communication: LivoxはVoice Engineを補助代替コミュニケーション(AAC)デバイスに統合し、非言語者が独自のロボット的でない音声を使用できるようにし、複数言語でも一貫性を保ちます。

グローバル展開と翻訳

  • Content Translation: HeyGenはこのモデルを動画翻訳に活用し、クリエイターが自分の声を複数の言語に翻訳しつつ、元の声質を保持できるようにしています。
  • Essential Service Delivery: DimagiはVoice EngineとGPT-4を組み合わせ、スワヒリ語やシェング(ケニアのコード混合言語)などの主要言語でコミュニティ保健従事者にインタラクティブなフィードバックを提供しています。

医療リカバリー

  • Voice Restoration: LifespanのNorman Prince Neurosciences Instituteは、言語障害を持つ患者を支援するためにこの技術をパイロットしています。あるケースでは、血管性脳腫瘍により流暢な会話を失った患者の声を、以前の学校プロジェクトの15秒クリップを使用して復元しました。

安全フレームワークと展開ガードレール

なりすましや欺瞞の可能性があるため、OpenAIは現在のプレビューに対して厳格な安全フレームワークを実装しています:

  • Consent and Policy: パートナーは、本人または組織の同意なしになりすますことを禁じる利用ポリシーを遵守しなければなりません。元の話者からの明示的かつインフォームドな同意が必要です。
  • Developer Restrictions: 開発者は、個々のユーザーが自分の声を作成できるツールの構築を禁じられています。
  • Transparency: すべてのAI生成音声は、聴衆に対して明確に開示しなければなりません。
  • Technical Safeguards: OpenAIは生成音声の出所を追跡するためのウォーターマーキングを実装し、使用状況の積極的なモニタリングを行っています。

OpenAIは、将来的な大規模展開には元の話者を検証する音声認証と、著名人物の音声再現を防止する「ノーゴーボイスリスト」を含めるべきだと提案しています。

社会的影響と提言

OpenAIは現在、説得力のある生成モデルに対する社会的レジリエンスを強化する必要があるとして、Voice Engineの広範なリリースを控えています。ラボは以下のシステム的な変更を推奨しています:

  • Security Updates: 銀行口座やその他の機密データへのアクセスに音声認証を使用することを段階的に廃止する。
  • Policy Development: AIにおける個人の声の合法的使用を保護するポリシーを策定する。
  • Public Education: AIの能力と限界、特に欺瞞的コンテンツのリスクに関する公共の認識を高める。
  • Provenance Tracking: 実在する人間とAIを区別するために、視聴覚コンテンツの出所を追跡する技術の採用を加速する。

Sources