Anthropic 500 万美元福祉研究资助计划
TL;DR
Anthropic 正在拨出 500 万美元的资助金,用于支持独立、开源的评估工作,以研究 AI 系统如何影响用户福祉。资助内容包括资金、模型访问权限以及技术支持。
项目概况
Anthropic 将向构建开源基准测试(benchmarks)的研究人员提供最高 500 万美元的资助,这些基准测试旨在衡量 AI 驱动的影响对心理和情感健康的影响。资助包括直接的资金支持、访问 Anthropic 模型的权限以及技术协助。受资助者将独立开展工作,并且必须在开源许可证下发布其工具,以便任何开发者都能采用这些评估方法。
为什么福祉评估具有挑战性
福祉评估不同于典型的准确性检查,因为它需要在长对话中具备上下文理解能力。模型的响应在一种情境下可能无害,但在另一种情境下可能有害——例如,向有进食障碍史的用户提供饮食建议。检测此类细微差别通常依赖于多轮对话动态,其中风险会逐渐升级,且用户可能仅在几次交流后才会透露敏感信息。
受资助评估项目的理想特征
Anthropic 的 Safeguards 团队提供了一份指导文档,概述了严格福祉基准测试的标准:
- Clear metrics – 定义明确的通过/失败条件并解释其相关性。
- Expert involvement – 邀请临床医生、心理学家或其他领域专家参与设计和验证。
- Balanced risk testing – 评估过度合规(过度宽容的响应)和过度拒绝(过度限制的响应)。
- Realistic usage scenarios – 模拟上下文发生变化且风险不断累积的多轮对话。
- Validated grading – 确保人类评分员根据公认的专家标准进行校准。
这些标准旨在产生既具有科学稳健性,又对 AI 行业具有实际用途的评估方法。
申请流程与时间线
感兴趣的团队可以通过公告中链接的公开表格进行申请。关键日期:
- Application deadline: September 21, 2026
- Notification of full-proposal invitations: October 5, 2026
入选的申请者将收到提交详细提案的进一步指示。
更广泛的背景与相关举措
Anthropic 的资助计划与其在安全防护(safeguards)和用户-模型交互研究方面的持续工作相辅成成。最近的相关工作包括:
- Claude text watermark – 一篇解释用于追踪模型输出的水印技术的技术博客。
- Fable 5 biology safeguards – 减少了与生物学相关查询的“回退”(fallback)事件误报的更新。
- Leadership appointment – 公布 Mariano-Florentino (Tino) Cuéllar 为首席全球事务官。
通过培养外部专业知识,Anthropic 旨在加速开发可靠的福祉指标,从而为整个行业更安全的 AI 部署提供指导。
如何获取指导材料
完整的评估指南集以 PDF 格式提供,由 Anthropic 托管:
鼓励研究人员在提交提案之前审阅该文档。
Anthropic 对开源福祉基准测试的承诺,反映了人们日益认识到,AI 安全必须从事实正确性扩展到涵盖用户的心理和情感健康。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch