在人機互動中促進自主性:史丹佛大學 CS547 HCI 研討會
在人機互動中促進自主性:史丹佛大學 CS547 HCI 研討會
從 AI 助手向 AI 顧問的轉型
隨著使用者越來越傾向於向大型語言模型 (LLMs) 尋求關於深度個人話題(例如健康、職業和人際關係)的建議,而非僅將其作為自動化任務的助手,人機互動正在經歷一場根本性的轉變。助手是代表使用者執行動作(例如編寫程式碼),而顧問則旨在透過改變使用者的信念與理解來增強使用者,使使用者自身能夠採取更好的行動。
這一區別至關重要,因為目前的 LLM 設計與評估範式專注於自動化。然而,對於個人成長與行為改變而言,目標並非自動化任務——因為 AI 無法替使用者去運動——而是賦予使用者行動的能力。這種方法反映了 Douglas Engelbart 開創的人機互動早期願景,他將電腦視為增強人類能力的工具,而非僅僅是計算機。
為健康行為改變設計自主性
健康行為改變是研究增強型 AI 的理想試驗場,因為其成功完全取決於使用者自身的行動。為了促進自主性,AI 系統必須避免「指令式」(prescriptive)——即盲目提供未經請求的建議或強加解決方案的行為——這往往會削弱使用者的自主權,且無法產生持續的改變。
定性背景的角色
有效的教練工作依賴於引發定性背景 (qualitative context)——即一個人改變背後的目標、價值觀和動機。雖然傳統的健康技術強調定量背景(例如步數、心率),但定性背景才是真正驅動行為改變的因素。
透過提出開放式問題(例如「為什麼你想變得更活躍?」),AI 顧問可以同時達成兩個目標:
- 收集提供一致且有效支持所需的資訊。
- 邀請使用者在過程中扮演積極角色,從而強化其自身的自主權。
實施非指令式策略
為了擺脫指令微調 (instruction-tuned) LLM 的指令式本質,研究人員利用動機式訪談 (Motivational Interviewing, MI) 的策略開發了 GPT Coach 系統。MI 是一種以證據為基礎的溝通風格,強調避免提供未經請求的建議,而是引發客戶自身的改變動機。
GPT Coach 利用三個特定的提示鏈 (prompt chains) 來確保非指令式行為:
- 對話狀態鏈 (Dialogue State Chain): 在長對話期間讓模型保持任務目標。
- 動機式訪談鏈 (Motivational Interviewing Chain): 強制模型在生成回應之前,必須從經過驗證的諮詢策略集(例如支持、開放式提問)中進行選擇。
- 工具使用鏈 (Tool Use Chain): 決定何時結合定量穿戴式感測器數據來增強對話,以肯定使用者的優勢,而非僅僅下達目標。
評估 LLM 增強型互動:GPT Coach 與 Bloom
對這些系統的研究表明,非指令式 AI 可以顯著影響使用者的心理與參與度。
GPT Coach 的發現
- 高保真度: 專家評分顯示,GPT Coach 在超過 93% 的時間裡使用了一致或中立的 MI 策略。
- 自主性支持: 參與者表示,該系統幫助他們反思自身的動機,並在不提供未經請求的建議的情況下,讓他們的想法變得更加具體。
- 與原生 LLM 的比較: 反事實分析顯示,原生的 GPT-4 比結構化的 GPT Coach 系統更容易傾向於說服與提供未經請求的建議。
Bloom:將教練功能整合至生態系統中
Bloom 將教練代理擴展為一個完整的 iOS 應用程式。它利用教練對話中引發的定性背景來實現後續互動的個性化,例如協作目標設定、推送通知和數據視覺化。
在一項包含 54 名參與者的為期 4 週的實地研究中,Bloom 顯示了:
- 心態轉變: 實驗組參與者對體育活動的信念表現出更細微的變化(例如,從「健身很討厭」轉變為將其視為日常生活中愉快的一部分)。
- 參與度提升: 實驗組使用者在 App 中花費的時間比對照組多出五倍以上。
- 自主性與控制感: 參與者將其積極的心態轉變歸功於掌控感以及對自身選擇的自主權。
應對不確定性的演算法方法
基於提示 (prompt-based) 的非指令式方法的一個主要局限在於它通常是「硬編碼」的,這會導致僵化或過度冗長。為了解決這個問題,研究提出了一個零樣本貝氏自適應規劃 (Zero-Shot Bayes Adaptive Planning) 框架,以幫助 LLM 策略性地應對關於使用者潛在狀態 ($\theta$) 的不確定性。
貝氏自適應 MDP 框架
在標準的馬可夫決策過程 (MDP) 中,代理人對所有使用者一視同仁。在貝氏自適應 MDP 中,代理人意識到每個使用者都是不同的,必須透過互動來學習特定使用者的特性。代理人必須在詢問具備資訊價值的問題(減少對 $\theta$ 的不確定性)與根據當前資訊採取行動的價值之間進行策略性的權衡。
三步驟規劃流水線
為了在沒有大量預訓練數據的情況下實現這一點,開發了一個多階段提示流水線:
- 信念引發 (Belief Elicitation): 提示 LLM 輸出關於使用者潛在屬性(例如改變階段)的後驗機率分佈。
- 策略排序 (Strategy Ranking): LLM 利用這些信念,根據預期的未來回報對高層級策略(例如「提問」與「提出建議」)進行排序。
- 動作生成 (Action Generation): LLM 根據所選策略和當前信念生成最終的語句。
不同環境下的結果
在運動建議、醫療診斷 (MedQ) 和談判 (Deal or No Deal) 環境下的測試顯示,該流水線帶來了顯著的策略改進。值得注意的是,透過對不確定性和信念進行顯式推理,它讓較小的模型(如 GPT-4o mini)能夠恢復到與大型前沿模型相當的性能水平。