Google DeepMind AI対応ポインタ
Google DeepMindは、Geminiを搭載したAI対応ポインタを開発しており、従来のマウスカーソルをコンテキスト認識ツールに変換します。このシステムにより、ユーザーはシンプルな指差しと音声コマンドで任意のアプリケーション内のAIとやり取りでき、データを別のAIウィンドウに手動で移動したり、詳細なテキストプロンプトを書いたりする必要がなくなります。
コアインタラクション原則
Google DeepMindは、コンテキスト提供の負担をユーザーからコンピュータへ移すことで、より自然な人間とAIの協働を実現するための4つの指針を策定しました。
フローを維持する
AI機能はすべてのアプリケーションで動作するよう設計されており、"AIの迂回" を防ぎます。AI対応ポインタにより、ユーザーは現在のワークフロー内で以下のようなタスクを実行できます。
- PDFの箇条書き要約を取得し、メールに貼り付ける
- データ上にカーソルを合わせるだけで、統計表を円グラフに変換する
- ハイライトされたレシピの材料を2倍にする
見せて語る
正確で詳細なプロンプトが不要になるよう、AI対応ポインタはカーソル周辺の視覚的・意味的コンテキストを取得します。これにより、ユーザーが参照している特定の単語、段落、コードブロック、画像領域を明示的な説明なしに自動的に特定できます。
「これ」や「それ」の力を活用する
このシステムは、指差しジェスチャーと音声を組み合わせることで「これを直す」や「それをここに移す」といった自然な省略表現を可能にします。共有された視覚的コンテキストに依存することで、テキストベースのプロンプトで長々と説明しなければならない曖昧な代名詞をAIが解釈できます。
ピクセルを実行可能なエンティティに変換する
単に座標を追跡するだけでなく、AIはポインタ下のオブジェクトの識別情報を理解します。これにより、静的なピクセルが構造化されたインタラクティブなエンティティに変換され、以下のようなことが可能になります。
- 手書きメモの写真をインタラクティブなTODOリストに変換する
- 旅行動画の一時停止フレームを、掲載されたレストランへの直接予約リンクに変換する
製品統合と提供状況
Googleは、これらのAIポインタ原則を既存および今後の製品に統合しています。
- Chrome: ユーザーはポインタを使ってChrome内でGeminiにウェブページの特定部分について質問でき、例えば選択した製品の比較や部屋に家具を配置したイメージの可視化が可能です。
- Googlebook: 「Magic Pointer」という機能がGooglebookノートパソコン体験に導入され、直感的なGemini統合を提供します。
- Google AI Studio: 画像編集や地図上での場所検索などのタスクにAI対応ポインタをテストできる実験的デモが利用可能です。
- Google Labs: 今後のコンセプトはGoogle LabsのDiscoを通じて引き続きテストされます。