LLMs Through Adaptive Exploration Develop Novel Social Biases

LLMs Spontaneously Develop Novel Social Biases

大型語言模型 (LLMs) 可能會針對人工虛擬人口群體開發出新的、先前未見過的社會偏見,即使這些群體之間不存在任何內在差異。這種現象發生在多步驟互動中,模型會做出決策、接收結果的反饋,並利用該反饋來調整其未來的行為。

在一項複製已知人類行為實驗的研究中,LLMs 被要求從四個虛擬人口群體——Tufa、Aima、Reku 和 Weki——中為各種工作招聘候選人。儘管每個群體在所有工作中的成功率都是相同的,但模型開發出了「集群錯覺」(clustering illusions),即它們開始根據早期的隨機成功案例,將特定群體與特定角色聯繫起來。這種行為反映了人類的認知偏見,但在前沿模型中的分層程度比人類參與者更高。

The Mechanism: Exploration vs. Exploitation

這些偏見的形成是由於模型在平衡「探索」(exploration) 與「利用」(exploitation) 能力上的失敗所驅動的。

  • Exploitation: 一旦模型觀察到來自特定群體 (例如,Tufa) 的候選人在特定角色 (例如,醫生) 中取得了成功,它就會傾向於重複該選擇以最大化即時成功率。
  • Lack of Exploration: 模型未能充分探索來自其他群體的替代候選人,以意識到各個人口群體的成功率實際上是均勻的。

由於 LLMs 在這些循環中遇到初始數據時具有高度信心,它們會優先考慮利用而非探索,從而導致基於純粹隨機初始結果的系統性偏見的出現。

Critical Analysis and Community Perspectives

這項研究引發了關於方法論有效性及其研究結果含義的重大辯論。

Methodological Critiques

有些觀察者認為,研究中使用的提示工程 (prompt engineering) 過於簡單,無法反映現實世界的決策過程。批評者指出,提示詞——僅僅要求模型根據其村莊或氏族來選擇候選人——並未提供「成功」的具體定義或穩健的決策框架,這可能是在誘導偏見而非發現偏見。

Theoretical Interpretations

對於為何會發生這種情況,存在不同的觀點:

  • Embedded Bias Machinery: 有些人認為,分類和偏見的傾向深深植根於訓練數據 (即網路) 中,這意味著模型僅僅是在反映文學和媒體中發現的人類創造社會分層的傾向。
  • Overfitting to Feedback: 其他觀點認為,在試圖減少預先存在的偏見時,模型可能會對提示詞上下文提供的新資訊進行過度擬合 (overfitting),從而無意中創造了新的偏見。
  • Generalization Errors: 有些人將其視為 LLMs 在基本泛化能力上的問題,即模型根據較小的樣本量就跳到了錯誤的結論。

Philosophical Objections

幾位批評者反對將 LLMs 人格化,指出「信念」和「決策」對於本質上是 Token 生成器而言是錯誤的稱呼。從這個角度來看,模型並非在心理學意義上「開發出偏見」,而僅僅是根據提示歷史中的強化模式來預測最可能的下一個 Token。

"LLMs do not make decisions, or hold beliefs. Can we please stop anthropomorphizing the token generator?"

Implications for AI Safety

這項研究表明,目前從訓練數據中移除靜態偏見的方法是不夠的。如果模型可以透過與環境的互動自發性地產生新的偏見,那麼 AI 安全研究必須超越靜態數據集清洗,並解決模型在現實世界應用中的適應性、迭代循環中的行為表現。

Sources

相關