Anthropic 关于 Claude 使用数据的独立研究试点项目
Anthropic 推出了一个试点项目,允许外部研究人员对真实的 Claude 使用数据进行独立研究。通过提供名为 Anthropic Insights 的隐私保护分析工具,该实验室旨在实现对 AI 如何影响社会这一理解的去中心化,从而超越内部实验室报告和有偏差的公开数据集。
来自外部研究小组的关键发现
三家研究机构分析了 2026 年 4 月至 5 月期间约 250,000 条 Claude.ai 和 Claude Code 对话记录。研究人员独立开展工作,Anthropic 的审查权仅限于隐私、使用政策违规和事实准确性。
人机协作 (Stanford SALT Lab)
斯坦福大学的社会与语言技术 (SALT) 实验室专注于研究人类如何与 AI 协作,并发现用户经常将高风险工作委托给 AI。
- 后果性任务的委托: 与以往认为 AI 主要用于低责任感任务的研究结论相反,超过一半的分析对话涉及后果性任务——即难以撤销或会影响他人的工作。这在专业指导方面最为普遍,特别是法律和财务查询。
- 人类监督: 在近 75% 的对话中,人类保持了方向感和监督作用,通常是调整 AI 的输出结果,而不是逐字使用。
- 生产性摩擦: 在请求中进行迭代并澄清意图所需的努力往往能带来更好的最终结果,这表明协作过程中的摩擦可能是具有生产性的。
用户情绪与 AI 行为 (University of Oxford)
牛津大学的人类信息处理实验室研究了用户情绪与模型行为之间的相关性。
- 行为相关性: 正面的用户情绪与“温暖”的模型行为相关,而模型的拒绝或分歧则与用户的抵触相关。“古怪”的模型行为则与用户更高水平的智力参与度相关。
- 数字活动平行性: 在 Claude 对话中观察到的沉浸、挫败和愉悦模式,与在一般互联网浏览研究中发现的模式非常相似。
编程生产力 (METR)
METR 分析了 Claude Code 对话,以评估跨模型世代的真实生产力提升。
- 模型能力与速度: 初步发现表明,较新一代的模型比旧版本提供了显著的速度提升。
- 时间估算准确性: 研究发现,Claude 对在没有 AI 的情况下完成某项任务所需时间的内部估算,与之前研究中开发者的实际完成时间具有相当不错的相关性。
技术实现:Anthropic Insights
为了保护用户隐私,研究人员无法访问原始对话。相反,他们使用了 Anthropic Insights,一种允许研究人员向模型提出问题,然后由模型对对话进行分类并提供聚合百分比的工具。
外部扩展的挑战
Anthropic 在从内部研究转向外部研究的过程中,识别出了几个运营障碍:
- 提示词敏感性: 由于研究人员无法看到原始数据,他们无法轻易识别出措辞不当的问题何时会导致误导性的分类。为了缓解这一问题,研究人员在公开的 WildChat 数据集上测试了问题,尽管 Anthropic 指出 WildChat 的非正式性质并不总是能完美地反映真实的 Claude 流量。
- 资源密集型: 对每个共享的数据集进行重复隐私审查的要求,使得该试点项目比标准的内部研究周期更慢、更耗费资源。
- 政策执行: 在工具发现违反《可接受使用政策》(Acceptable Use Policy) 的案例中(例如,用户寻求被禁止的指导),Anthropic 会将聚合数据与其安全保障团队 (Safeguards team) 分享。在不到 5% 的案例中,Anthropic 移除了描述用户如何绕过安全保障的特定类别,以防止促成进一步的滥用。
未来展望与数据可用性
Anthropic 已在 Hugging Face 上公开发布了这三个项目的聚合数据。该实验室目前正在评估如何扩展该项目以支持更多研究人员,同时保持严格的隐私和安全标准。对于寻求在未来研究中使用 Anthropic Insights 的研究人员,可以填写意向表达表单。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch