ChatGPT 音声と画像機能アップデート

OpenAIは音声と画像機能をChatGPTに統合し、インターフェースをテキストのみからマルチモーダル体験に変換しました。このアップデートにより、ユーザーはリアルタイムの音声会話を行い、モデルが分析および議論できる視覚的入力を提供できるようになります。

音声インタラクション機能

ChatGPTは双方向の音声会話をサポートし、ユーザーはハンズフリーでアシスタントと対話できるようになりました。この機能は、iOSおよびAndroidの「New Features」メニューのオプトイン設定から利用できます。

音声の技術的実装

音声体験は、以下の2つの主要技術の組み合わせによって駆動されます:

  • Text-to-Speech (TTS): テキストと数秒のサンプル音声から人間らしい音声を生成できる新しいモデル。利用可能な音声は、プロの声優と協力して作成されました。
  • Speech Recognition: OpenAIのオープンソースWhisperシステムが使用され、話された言葉をテキストに変換してモデルが処理できるようにします。

画像理解と視覚的入力

ユーザーは今、1つ以上の画像をChatGPTに提供し、ハードウェアのトラブルシューティング、パンティの中身に基づく食事計画、複雑なデータグラフの分析などのタスクを実行できるようになりました。モバイルデバイスでは、ユーザーが画像の特定の部分にモデルの注意を向けるのを助ける描画ツールが利用できます。

マルチモーダルモデルアーキテクチャ

画像理解は、GPT-3.5とGPT-4のマルチモーダルバージョンによって駆動されます。これらのモデルは、写真、スクリーンショット、テキストと画像を組み合わせたドキュメントなど、さまざまな視覚フォーマットに言語推論スキルを適用します。

安全性と展開戦略

OpenAIはこれらの機能を2週間かけてPlusおよびエンタープライズユーザーに段階的に展開し、後で開発者やその他のユーザーグループへのアクセスを拡大する予定です。この段階的なロールアウトは、リスク軽減策を洗練させ、より強力なシステムに備えることを目的としています。

音声の安全性とリスク軽減

現実的な合成音声を作成できる能力は、なりすましや詐欺に使用される可能性があるため、OpenAIはこの技術の適用を特定のユースケースに限定しています:プロの俳優によって作成された音声を使用した音声チャット。ChatGPT以外では、OpenAIはSpotifyなどのパートナーと協力し、ポッドキャスター向けの音声翻訳機能のパイロットを実施しています。

ビジョンの安全性とプライバシー

人物に関する幻覚やハイステークドメインでの悪用などのリスクに対処するため、OpenAIは以下の対策を実施しました:

  • Red Teaming: モデルは、科学的熟練度と過激主義に関連するリスクについて、レッドチーマーとアルファテスターによってテストされました。
  • Privacy Restrictions: プライバシーを保護し精度を確保するため、ChatGPTが人物を分析し直接的な発言を行う能力を大幅に制限する技術的対策が実施されました。
  • Accessibility Collaboration: ビジョン機能の開発は、盲弱視者向けアプリBe My Eyesとの作業によって情報提供されました。

モデルの制限

OpenAIは、視覚機能に関する特定の制限を指摘しています:

  • Verification Required: 適切な検証がないまま高リスクのユースケースでモデルを使用することは推奨されません。
  • Language Constraints: モデルは英語テキストの転写に熟練していますが、ローマ字以外のスクリプトを使用する他の言語では性能が低下します。

Sources