LLMs 通过自适应探索产生新型社会偏见

LLMs 自发产生新型社会偏见

大型语言模型 (LLMs) 可能会针对人工人口统计群体产生新的、此前未见的社会偏见,即使这些群体之间不存在内在差异。这种现象发生在多步交互过程中,模型做出决策,接收关于结果的反馈,并利用该反馈来调整其未来的行为。

在一项复制已知人类行为实验的研究中,LLMs 被要求为各种工作从四个虚构的人口统计群体——Tufa、Aima、Reku 和 Weki——中招聘候选人。尽管所有工作岗位中每个群体的成功率都是相同的,但模型产生了“聚类错觉 (clustering illusions)”,即它们开始根据早期的、随机的成功案例将特定群体与特定角色联系起来。这种行为反映了人类的认知偏见,但在前沿模型中发生的阶层化程度比人类参与者更高。

机制:探索与利用

这些偏见的产生是由模型在平衡探索 (exploration) 与利用 (exploitation) 能力方面的失败驱动的。用技术术语来说,这类似于多臂老虎机问题 (multi-armed bandit problem),其中模型过度索引了早期的正向强化。

  • 利用 (Exploitation): 一旦模型观察到来自特定群体(例如 Tufa)的候选人在特定角色(例如医生)中取得了成功,它往往会重复该选择以最大化即时成功率。
  • 缺乏探索 (Lack of Exploration): 模型未能充分探索来自其他群体的替代候选人,从而无法意识到所有人口统计群体的成功率实际上是统一的。

由于 LLMs 在这些循环中遇到的初始数据具有高度置信度,它们优先考虑利用而非探索,从而导致基于纯粹随机的初始结果产生系统性偏见。

批判性分析与社区观点

该研究引发了关于方法论有效性和研究结果含义的重大辩论。

方法论批判

一些观察者认为,研究中使用的提示词工程 (prompt engineering) 太过简单,无法反映现实世界的决策过程。批评者指出,提示词——即简单地要求模型根据其村庄或氏族来选择候选人——并没有提供“成功”的具体定义或稳健的决策框架,这可能会诱导偏见而非发现偏见。

理论解释

对于这种现象发生的原因,存在不同的观点:

  • 嵌入式偏见机制: 一些人认为,分类和产生偏见的倾向深深植根于训练数据(互联网)中,这意味着模型只是在反映文学和媒体中发现的人类创造社会阶层化的倾向。
  • 过度拟合反馈: 其他观点认为,为了减少预先存在的偏见,模型可能会过度拟合提示词上下文中提供的新信息,从而在无意中创造了新的偏见。
  • 泛化错误: 有些人将其视为 LLMs 在基础泛化问题上的证据,即模型基于较小的样本量就跳到了错误的结论。

哲学反对意见

几位批评者反对将 LLMs 人格化,指出“信念”和“决策”对于本质上是 Token 生成器的东西来说是误称。从这个角度来看,模型并不是在心理学意义上“产生偏见”,而只是在根据提示历史中的强化模式预测最可能的下一个 Token。

"LLMs 不做决策,也不持有信念。请停止将 Token 生成器人格化好吗?"

对 AI 安全性的启示

研究表明,目前从训练数据中移除静态偏见的方法是不够的。如果模型可以通过与环境的交互自发产生新的偏见,那么 AI 安全研究必须超越静态数据集清洗,并着手解决模型在现实世界应用中的自适应、迭代循环中的行为表现。

Sources

相关