Anthropic 教育报告:AI 流利度指数

Anthropic 推出了 AI 流利度指数(AI Fluency Index),这是一个旨在追踪个人如何随着时间的推移发展出有效使用 AI 技能的基准测量指标。研究显示,AI 流利度最常见的表现形式是通过增强型协作——将 AI 视为思维伙伴——并且与那些进行迭代优化而非直接接受初始输出的用户表现出最强的相关性。

4D AI 流利度框架

为了量化流利度,Anthropic 利用了由 Rick Dakan 教授和 Joseph Feller 教授开发的 4D AI 流利度框架。该框架定义了 24 种体现安全且有效的“人-AI 协作”的具体行为。

在本研究中,研究人员专注于 Claude.ai 和 Claude Code 对话中 11 种直接可观察的行为。其余 13 种行为(例如对 AI 在工作中的角色保持诚实,或考虑分享输出的后果)发生在聊天界面之外,需要通过定性评估来进行未来的研究。

方法论

  • 样本量: 9,830 场匿名对话。
  • 时间范围: 2026 年 1 月的一个 7 天窗口期。
  • 工具: 使用 Anthropic 的隐私保护工具 Clio 进行分析。
  • 验证: 结果在不同日期和多种语言之间进行了一致性验证。

关键发现:迭代与辨别力

迭代是流利度的驱动力

迭代与优化——在之前交流的基础上改进工作——是所有其他流利度行为中单一最强的相关因素。

  • 普遍性: 85.7% 的样本对话表现出了迭代与优化。
  • 影响: 与非迭代对话(1.33)相比,涉及迭代的对话表现出两倍以上的流利度行为数量(平均增加 2.67 个行为)。
  • 评估: 进行迭代的用户质疑模型推理的可能性高出 5.6 倍,识别缺失上下文的可能性高出 4 倍。

“人工制品悖论”(Artifact Paradox)

当用户创建 artifacts(代码、文档或交互式工具)时,其行为会转向更高的指令性但更低的批判性评估。

  • 增加的指令性: 在基于 artifact 的对话中(占样本的 12.3%),用户更有可能澄清目标(+14.7pp)、指定格式(+14.5pp)并提供示例(+13.4pp)。
  • 降低的辨别力: 尽管指令性更强,但这些用户识别缺失上下文的可能性较低(-5.2pp)、检查事实的可能性较低(-3.7pp)或质疑模型推理的可能性较低(-3.1pp)。

Anthropic 表明,这可能是因为精美且看起来功能完备的输出会导致用户假设工作已经完成,或者因为用户通过聊天日志中不可见的外部手段(例如运行代码)来评估 artifacts。

开发 AI 流利度的建议

基于数据模式,Anthropic 确定了用户改进的三个主要领域:

  1. 优先考虑迭代: 将初始响应视为起点。用户应当提出后续问题并针对不准确之处提出异议,以优化输出。
  2. 批判性地评估精美的输出: 当输出看起来很专业时,用户应当有意识地停下来验证准确性和推理过程,因为精美的外观往往与较低的批判性评估率相关。
  3. 定义协作条款: 只有 30% 的用户明确告诉 AI 如何与他们互动。鼓励用户设定预期,例如要求 AI “如果我的假设是错误的,请反驳我”或“带我理清你的推理过程”。

研究局限性

Anthropic 指出关于 AI 流利度指数的几点注意事项:

  • 人口统计偏差: 样本由 Claude.ai 的早期采用者组成,可能无法代表普通人群。
  • 范围: 研究仅追踪了 24 种框架行为中的 11 种;伦理和负责任的使用行为未被纳入。
  • 测量: 研究对行为采用了二元分类(存在/不存在),这可能会忽略细微差别。
  • 隐性评估: 用户可能会在心理上或在外部进行事实核查,而未在对话中记录下来。
  • 相关性而非因果关系: 研究结果是相关性的,并不能证明一种行为会导致另一种行为。

未来研究方向

Anthropic 打算通过进行队列分析来比较新用户与经验丰富的用户,并使用定性方法来评估不可观察的行为,从而扩展这项研究。此外,实验室计划进一步探索 Claude Code 中的 AI 流利度,以确定软件开发人员是否表现出不同的流利度模式。

Sources

相关