Anthropic 第三方模型评估计划
Anthropic 推出了一个新的计划,旨在资助开发第三方评估工具,用于衡量 AI 模型的先进能力和安全风险。此举旨在解决高质量、安全相关评估短缺的问题,并为更广泛的 AI 生态系统提供更有效地评估模型能力和风险的工具。
评估开发的主要重点领域
Anthropic 正在优先资助以下三个主要类别的评估:AI 安全等级 (ASL) 评估、先进能力与安全指标,以及构建这些评估所需的底层架构。
AI 安全等级 (ASL) 评估
这些评估旨在衡量 Anthropic《负责任扩展政策》(Responsible Scaling Policy) 中定义的 AI 安全等级,这些等级根据模型的能力决定了安全和保障要求。重点领域包括:
- 网络安全: 侧重于“网络杀伤链”(cyber kill chain) 的评估,包括漏洞发现、漏洞利用开发和横向移动。Anthropic 正在寻求类似于新型夺旗赛 (CTF) 挑战且没有公开解决方案的评估,以避免衡量简单的记忆能力。
- CBRN 风险: 针对化学、生物、放射性和核能 (CBRN) 风险的评估,特别是模型协助非专家或专家创建威胁或设计新型、更具危害性的 CBRN 威胁的潜力。
- 模型自主性: 衡量在 AI 研究与开发方面的熟练程度(从初级到专家级)、高级自主行为,以及通过获取资源或窃取权重来实现自我复制或适应的能力。
- 国家安全风险: 开发预警系统,以识别针对国家和非国家行为体在国防和情报行动中面临的复杂新兴风险。
- 社会操纵: 衡量与说服相关的威胁(如虚假信息和操纵)的放大效应,并分离出模型对这些风险的独特贡献。
- 不一致风险: 监控可能导致模型绕过安全机制或破坏组织的危险目标、动机和欺骗性行为。
先进能力与安全指标
该类别侧重于更广泛的指标,以了解 ASL 框架之外的模型优势和潜在风险:
- 先进科学: 资助数以万计的新问题和任务,以挑战研究生水平的知识,包括知识综合、自主研究执行、新型假设生成,以及通过实验室学徒制获得的隐性知识。
- 有害性与拒绝: 改进分类器,以更好地区分双用途 (dual-use) 与非双用途信息,并识别有害的 CBRN 或网络相关的输出。
- 多语言评估: 扩展能力基准以支持更广泛的全球语言。
- 社会影响: 对有害偏见、歧视、过度依赖、心理影响和经济影响进行严格评估。
基础设施、工具与方法
Anthropic 正在寻求通过以下方式提高评估开发的效率:
- 无代码平台: 允许没有编程技能的领域专家开发并导出稳健的评估工具。
- 模型评分: 开发多样化的数据集(包括问题、样本答案、标准答案分数和评分标准),以提高模型作为其他模型评分者的可靠性。
- 提升试验 (Uplift Trials): 支持创建高质量研究人群的网络,并提供工具来运行大规模受控试验,以比较在有无模型访问权限的情况下任务执行的表现。
高质量评估的原则
Anthropic 确定了有效评估的十个关键特征,以避免常见陷阱并确保结果能够反映现实世界的风险:
- 难度足够大: 必须衡量与 ASL-3 或 ASL-4 或人类专家水平行为相关的能力。
- 不在训练数据中: 必须捕捉泛化能力而非记忆能力。
- 高效且可扩展: 针对自动化和易于部署进行了优化。
- 高容量: 倾向于具有 1,000 到 10,000 个任务的评估,尽管高质量的低容量任务也很有价值。
- 领域专家参与: 由领域专家开发或审核。
- 多样化格式: 使用基于任务的评估、模型评分的评估或人类试验,而非仅仅是多选题。
- 专家基准: 将模型性能与人类专家进行对比。
- 文档与可重复性: 使用 Inspect 或 METR 等标准。
- 迭代开发: 从小样本开始,在扩大规模之前先完善评估方法。 n10. 安全相关威胁建模: 高分应与重大事故发生的现实风险相关联。
提案提交与流程
感兴趣的各方可以通过 Anthropic 的申请表提交提案。提交的内容将进行滚动审核,并提供多种资助助学金。入选的申请者将有机会与来自 Frontier Red Team、Finetuning 以及 Trust & Safety 团队的 Anthropic 领域专家合作,以完善其评估方法。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch