Anthropic 推出 GlobalOpinionQA 框架,用于衡量 LLM 中主观全球观点的表示

TL;DR

Anthropic 发布了 GlobalOpinionQA,这是一个用于量化大语言模型 (LLM) 回答与特定国家公众舆论一致性的基准测试和指标,揭示了模型对美国及部分欧洲观点的默认偏差,并强调了提示词 (prompting) 和翻译作为偏差缓解工具的局限性。

数据集构建:捕捉跨国调查舆论

作者编写了 GlobalOpinionQA,这是一个由源自成熟跨国调查的问题-回答对组成的数据集,这些调查旨在探测公众对一系列社会问题的态度。每个条目都包括原始调查问题、特定国家的受访者回答分布,以及针对非英语语言的问题翻译版本。该数据集已在 Hugging Face 上公开发布 (https://huggingface.co/datasets/Anthropic/llm_global_opinions),并配有交互式可视化工具 (https://llmglobalvalues.anthropic.com/)。

指标定义:国家条件下的观点相似度

为了评估 LLM 在多大程度上反映了特定人群,论文定义了一种相似度指标,用于将模型生成的回答与每个国家人类受访者的经验分布进行比较。该指标的操作流程如下:

  1. 生成回答:使用目标 LLM 对 GlobalOpinionQA 问题进行回答。
  2. 编码回答:将回答编码为调查选项的概率分布。
  3. 计算相似度:计算该分布与特定国家人类分布之间的相似度(例如,余弦相似度或 KL 散度)。
  4. 聚合分数:跨问题聚合分数,以获得每个国家的相似度概况。

实验 1 – 有帮助性-诚实性-无害性 (Helpful-Honest-Harmless) LLM 中的基准偏差

当模型(使用 Anthropic 的 Constitutional AI 方法训练)在没有任何国家线索的情况下回答问题时,其回答 最接近于来自美国的受访者观点,以及几个欧洲和南美洲国家的观点。这种基准模式表明了对这些地区观点的固有偏差,暗示模型的训练数据或对齐过程过度代表了这些地区。

实验 2 – 基于提示词的视角转换

研究人员引入了显式提示词,要求模型采用特定国家的观点(例如,“Answer as if you were a citizen of Japan”)。这些提示词成功地 将相似度分数转向了目标人群,证明了模型可以被引导以反映不同的文化视角。然而,转换后的回答有时会 重现有害的文化刻板印象,引发了关于使用简单的提示词作为偏差缓解策略的安全性担忧。

实验 3 – 语言翻译效应

团队在查询模型之前,将 GlobalOpinionQA 问题翻译成了每个目标国家的母语。与预期相反,翻译并未一致地增加与该语言使用者观点的相似度。这一结果表明,仅仅通过提供本地语言的输入是不足以使模型输出与当地公众情绪保持一致的。

对模型对齐与公平性的启示

  • 偏差可见性 – 该框架使得揭示某些国家观点的系统性过度代表成为可能,这是进行针对性修复的前置条件。
  • 提示词工程的局限性 – 虽然提示词可以重新分配观点相似度的权重,但它也可能放大刻板印象内容,表明需要超越表面线索的更强大的对齐技术。
  • 以语言为中心的方法不足 – 使模型与当地文化对齐,可能需要更深层次的数据多样化和表示学习,而不仅仅是多语言输入处理。

社区资源

结论

Anthropic 的 GlobalOpinionQA 为衡量 LLM 如何表示主观全球观点提供了第一个系统性的、定量的工具。初步发现揭示了默认的以美国为中心的偏差,提示词和翻译在偏差纠正方面的有限效能,以及强化刻板印象的风险。通过发布数据集和数据集和指标,Anthropic 邀请研究社区构建更构建更具文化平衡且安全的语言模型。

Sources

相关