人間とAIの相互作用におけるエージェンシーの促進:スタンフォード CS547 HCI セミナー
人間とAIの相互作用におけるエージェンシーの促進:スタンフォード CS547 HCI セミナー
AIアシスタントからAIアドバイザーへのシフト
人間とAIの相互作用は根本的な変化を迎えており、ユーザーはタスク自動化アシスタントとしてだけでなく、健康、キャリア、恋愛関係などの深く個人的なテーマについて助言を求めて、大規模言語モデル(LLM)を利用することが増えています。アシスタントがユーザーに代わって行動(例:コードを書く)を実行するのに対し、アドバイザーはユーザーの信念や理解を変えることでユーザーを補強し、ユーザー自身がより良い行動を取れるようにします。
この区別は重要です。現在のLLMの設計・評価パラダイムは自動化に焦点を当てているからです。しかし、個人の成長や行動変容においては、タスクを自動化すること(AIがユーザーの代わりに運動できない)ではなく、ユーザーが行動できるように力を与えることが目的です。このアプローチは、コンピュータを単なる計算機ではなく人間の補強ツールとみなしたダグラス・エンゲルバートが提唱した初期のHCIビジョンと一致します。
健康行動変容におけるエージェンシー設計
健康行動変容は、成功が完全にユーザー自身の行動に依存するため、補強的AIを研究する理想的なテストベッドです。エージェンシーを促進するために、AIシステムは「指示的」になること—無差別に助言を提供したり解決策を押し付けたりする行為—を避けなければなりません。これはしばしばユーザーの自律性を損ない、持続可能な変化を生み出せません。
定性的コンテキストの役割
効果的なコーチングは、定性的コンテキスト—変化の理由の根底にある目標、価値観、動機—を引き出すことに依存します。従来の健康テクノロジーは定量的コンテキスト(例:歩数、心拍数)を重視しますが、実際に行動変容を促すのは定性的コンテキストです。
オープンエンドの質問(例:「なぜもっと活動的になりたいのですか?」)をすることで、AIアドバイザーは同時に二つの目標を達成します:
- 整合性のある効果的なサポートを提供するために必要な情報を収集する。
- ユーザーにプロセスへの積極的な関与を促し、自己の自律性を強化する。
非指示的戦略の実装
指示調整されたLLMの指示的性質から離れるために、GPT CoachシステムはMotivational Interviewing (MI) の戦略を用いて開発されました。MIは、無差別な助言を避け、クライアント自身の変化の理由を引き出すことを重視したエビデンスに基づくコミュニケーションスタイルです。
GPT Coachは非指示的な振る舞いを保証するために、以下の3つのプロンプトチェーンを利用します:
- Dialogue State Chain: 長い会話の間、モデルがタスクに集中し続けるようにします。
- Motivational Interviewing Chain: 応答を生成する前に、検証済みのカウンセリング戦略(例:サポート、オープンエンド質問)から選択させます。
- Tool Use Chain: 定量的なウェアラブルセンサーデータで会話を補強し、ユーザーの強みを確認するタイミングを判断し、単に目標を指示するだけにしません。
LLM拡張インタラクションの評価:GPT Coach と Bloom
これらのシステムに関する研究は、非指示的AIがユーザーの心理とエンゲージメントに大きな影響を与えることを示しています。
GPT Coach の調査結果
- 高忠実度: 専門家によるコーディングで、GPT Coach が一貫したまたは中立的な MI 戦略を 93% 以上の時間で使用していることが示されました。
- エージェンシー支援: 参加者は、システムが自分の動機を振り返るのに役立ち、無差別な助言を提供せずにアイデアをより具体的にしたと報告しました。
- バニラLLMとの比較: 反事実分析により、標準的な GPT-4 は構造化された GPT Coach システムに比べ、説得や無差別な助言に大幅に傾きやすいことが明らかになりました。
Bloom:エコシステムへのコーチング統合
Bloom はコーチングエージェントをフル iOS アプリケーションに拡張しました。コーチング会話中に引き出された定性的コンテキストを利用して、共同目標設定、プッシュ通知、データ可視化などの下流インタラクションをパーソナライズしました。
4 週間のフィールドスタディ(参加者 54 名)で、Bloom は次の成果を示しました:
- マインドセットの変化: 介入群の参加者は、身体活動に対する信念がより微妙に変化したことを示しました(例:「運動は嫌い」から、日常の楽しい一部として捉えるように)。
- エンゲージメントの増加: 介入群のユーザーは、対照群に比べてアプリ使用時間が 5 倍以上でした。
- エージェンシーとコントロール: 参加者は、ポジティブなマインドセットの変化を、自分がコントロールし選択にエージェンシーを持っている感覚に起因すると述べました。
不確実性に対処するアルゴリズム的アプローチ
プロンプトベースの非指示性の主な制限は、しばしば「ハードコーディング」されているため、硬直性や過度の冗長さを招くことです。これを解決するために、研究は Zero-Shot Bayes Adaptive Planning のフレームワークを提案し、LLM がユーザーの潜在状態 ($\theta$) に関する不確実性を戦略的にナビゲートできるようにします。
ベイズ適応MDPフレームワーク
標準的なマルコフ決定過程(MDP)では、エージェントはすべてのユーザーを同一視します。ベイズ適応MDP では、エージェントは各ユーザーが異なることを認識し、インタラクションを通じて特定のユーザーについて学習しなければなりません。エージェントは、情報的な質問をする価値($\theta$ の不確実性を減らす)と、現在の情報に基づいて行動する価値を戦略的にトレードオフする必要があります。
3ステップ計画パイプライン
このアプローチを大量の事前学習データなしで実装するために、マルチステージのプロンプトパイプラインが開発されました:
- 信念の引き出し: LLM に対し、ユーザーの潜在属性(例:変化の段階)に関する事後確率分布を出力するようプロンプトします。
- 戦略のランク付け: LLM はこれらの信念を用いて、期待される将来のリターンに基づき高レベル戦略(例:「質問する」対「提案する」)をランク付けします。
- 行動生成: LLM は選択された戦略と現在の信念に基づいて最終的な発話を生成します。
環境別の結果
運動推奨、医療診断(MedQ)、交渉(Deal or No Deal)といった環境でテストした結果、このパイプラインが大幅なポリシー改善をもたらすことが示されました。特に、GPT-4o mini のような小規模モデルでも、不確実性と信念を明示的に推論することで、はるかに大きな最先端モデルに匹敵する性能を回復できました。