促进人机交互中的主动性:斯坦福CS547 HCI研讨会

促进人机交互中的主动性:斯坦福CS547 HCI研讨会

从AI助手到AI顾问的转变

随着用户越来越多地求助于大型语言模型(LLM)来获取健康、职业和人际关系等深层个人话题的建议,而不仅仅是将其用作任务自动化助手,人机交互正在经历根本性的转变。虽然助手代表用户执行操作(例如编写代码),但顾问旨在通过改变用户的信念和理解来增强用户,使用户能够自行采取更好的行动。

这一区别至关重要,因为当前的LLM设计和评估范式侧重于自动化。然而,对于个人成长和行为改变,目标不是自动化任务——因为AI无法替用户锻炼——而是赋予用户行动的能力。这种方法与道格拉斯·恩格尔巴特开创的人机交互早期愿景相呼应,他认为计算机是人类增强的工具,而不仅仅是计算器。

为健康行为改变设计主动性

健康行为改变是研究增强型AI的理想试验床,因为其成功完全取决于用户自身的行动。为了促进主动性,AI系统必须避免成为“规定性的”——即盲目提供未经请求的建议或强加解决方案——这往往会削弱用户自主权,且难以产生持续的改变。

定性背景的作用

有效的教练依赖于引出定性背景——即导致一个人改变原因的目标、价值观和动机。虽然传统健康技术强调定量背景(例如步数、心率),但定性背景才是实际驱动行为改变的因素。

通过提出开放式问题(例如,“你为什么想要更活跃?”),AI顾问同时实现两个目标:

  1. 它收集提供一致、有效支持所需的信息。
  2. 它邀请用户在过程中发挥积极作用,从而增强其自身的自主性。

实施非规定性策略

为了摆脱指令调优LLM的规定性特征,GPT Coach系统采用了**动机访谈(MI)**的策略进行开发。MI是一种基于证据的沟通风格,强调避免未经请求的建议,而是引导客户自身的改变原因。

GPT Coach利用三个特定的提示链来确保非规定性行为:

  • Dialogue State Chain: 在长对话过程中保持模型专注于任务。
  • Motivational Interviewing Chain: 在生成响应之前,迫使模型从一组经过验证的咨询策略中选择(例如,支持、开放式提问)。
  • Tool Use Chain: 决定何时使用可穿戴传感器的定量数据来增强对话,以肯定用户的优势,而不仅仅是规定目标。

评估LLM增强的交互:GPT Coach和Bloom

对这些系统的研究表明,非规定性AI能够显著影响用户心理和参与度。

GPT Coach的发现

  • 高保真度: 专家编码显示,GPT Coach在超过93%的时间里使用了一致或中性的MI策略。
  • 主动性支持: 参与者报告称,该系统帮助他们反思自身动机,并使他们的想法更具具体性,而未提供未经请求的建议。
  • 与原始LLM的比较: 反事实分析表明,原始GPT-4相比结构化的GPT Coach系统,更容易说服和提供未经请求的建议。

Bloom:将教练融入生态系统

Bloom将教练代理扩展为一个完整的iOS应用程序。它利用在教练对话过程中引出的定性背景来个性化后续交互,例如协作目标设定、推送通知和数据可视化。

在为期4周的野外研究中,共有54名参与者,Bloom展示了:

  • 思维转变: 接受干预的参与者表达了对身体活动信念的更细腻变化(例如,从“锻炼很糟糕”转变为将其视为他们日常生活中愉快的一部分)。
  • 参与度提升: 接受干预的用户在应用中花费的时间是对照组的五倍以上。
  • 主动性和控制感: 参与者将他们的积极思维转变归因于他们感到自己掌控局面并能够对自己的选择拥有主导权。

应对不确定性的算法方法

基于提示的非规定性方法的主要局限在于它经常被“硬编码”,导致僵化或冗长。为了解决这一问题,研究提出了一个零样本贝叶斯自适应规划框架,以帮助LLM战略性地应对关于用户潜在状态($\theta$)的不确定性。

贝叶斯自适应MDP框架

在标准马尔可夫决策过程(MDP)中,代理将所有用户视为相同。在贝叶斯自适应MDP中,代理认识到每个用户都不同,并且必须通过交互来了解特定用户。代理必须在提出信息性问题的价值(减少关于$\theta$的不确定性)与根据当前信息行动的价值之间进行战略权衡。

三步规划流水线

为了在没有大量先前训练数据的情况下实现这一点,开发了一个多阶段提示流水线:

  1. 信念引出: 提示LLM输出用户潜在属性的后验概率分布(例如,改变阶段)。
  2. 策略排序: LLM利用这些信念基于预期未来回报对高层次策略进行排序(例如,“提问”与“提出建议”)。
  3. 行动生成: LLM根据所选策略和当前信念生成最终的话语。

各环境中的结果

在运动推荐、医学诊断(MedQ)和谈判(Deal or No Deal)等环境中的测试表明,此流水线带来了显著的策略改进。值得注意的是,它使较小的模型(如GPT-4o mini)能够通过明确推理不确定性和信念,恢复到与更大的前沿模型相当的性能水平。

Sources