OpenAIがBe My Eyes向けにGPT‑4搭載のバーチャルボランティアを発表

TL;DR

OpenAIはGPT‑4の視覚入力機能をBe My Eyesアプリに統合し、「バーチャルボランティア」を開始しました。このボランティアは画像を説明・分析・会話でき、盲目や低視力のユーザーにリアルタイムで文脈豊かな支援を提供します。

発表内容

OpenAIは、デンマークのスタートアップBe My EyesがGPT‑4(リサーチプレビュー)をモバイルアプリに組み込み、Virtual Volunteer™を提供することを発表しました。このアシスタントはユーザーが送信した写真を処理し、詳細な説明を生成し、フォローアップの質問に答え、レシピの提案やナビゲーション指示など実用的なアドバイスを提供できます。

なぜ重要か

Virtual Volunteerは、従来の画像→テキストツールを超える視覚解釈と対話的なダイアログを提供し、世界で推定2億5千万人の盲目または低視力の人々により大きな自立をもたらすことが期待されています。

技術的基盤

  • GPT‑4視覚入力: モデルはテキストに加えて画像データも受け取り、マルチモーダル推論を可能にします。
  • 対話コンテキスト: 静的な物体認識APIとは異なり、GPT‑4は往復の対話を維持し、ユーザーのプロンプトに基づいて回答を洗練できます。
  • 分析力: システムは単に物体を命名するだけでなく、関係性を推測し、安全リスクを評価し、次のステップを提案できます(例:「この麺はレシピに適していますか?」)。

コア機能

画像の説明と分析

アシスタントは物体を識別し、画像内のテキストを読み取り、微妙な説明を提供できます。例えば、冷蔵庫の写真からは、アイテムのリスト、可能なレシピ、栄養情報が得られます。

リアルタイムナビゲーション支援

ユーザーは鉄道駅内でステップバイステップの案内を受け、マップ上の位置表示や安全警告も含め、モデルが複雑な空間情報を解釈できることを示しました。

ウェブページの理解

GPT‑4はウェブページ全体を提示され、最も関連性の高いセクションを要約し、雑音を除去し、簡潔な回答を提示できます。これにより、ユーザーはニュースサイトや e‑コマースページ、その他視覚的に密集したコンテンツを閲覧しやすくなります。

初期テストとフィードバック

  • ベータ展開: 2023年2月初旬、Be My Eyesは従業員の小規模グループで内部ベータテストを開始しました。
  • 好評: CEOのMichael Buckleyは、既存の画像→テキストツールと比較して「比類なき」性能と評価しました。アクセシビリティ提唱者のLucy Edwardsを含むベータ参加者は、新機能に対する熱意を示しました。

“GPT‑4と他の言語・機械学習モデルとの違いは、会話ができる能力と、技術が提供する高度な分析力の両方にあります。” – Jesper Hvirring Henriksen, CTO, Be My Eyes

アクセシビリティへの影響

  • 自立の向上: ユーザーは人間のボランティアを待つことなく、即座に詳細な視覚情報を取得でき、単独で実行できるタスクの範囲が広がります。
  • 適用範囲の拡大: 日常の物体に留まらず、画面の読み取り、製品の安全性評価、混雑した e‑コマースサイトでの購入判断などを支援できます。
  • 商業的可能性: Buckleyは、社会的利益とAI駆動のアクセシビリティソリューションの大きな市場機会という二重のインパクトを強調しました。

今後のステップ

OpenAIとBe My Eyesは、ベータテスト開始から数週間以内にVirtual VolunteerをBe My Eyesの広範なユーザーベースに展開し、ユーザーフィードバックとさらなる安全性評価に基づく継続的な改良を行う計画です。


この投稿は2023年3月14日付の公式OpenAI発表を要約したものです。すべての記述は元資料から直接引用しています。

Sources