Anthropic 向 NTIA 提交的 AI 问责制建议书
Anthropic 向美国国家电信和信息管理局(NTIA)提交了一份关于 AI 问责制的正式回应。该提案概述了一种评估先进人工智能系统的结构化方法,以确保随着模型能力的提升,安全性与问责制能够得到保障。
Standardized Evaluations and Funding
Anthropic 建议增加政府对 AI 模型评估研究的资金投入,以创建严谨、标准化的基准测试。由于开发这些评估方法需要消耗大量资源,公共资金被视为推动进步的关键驱动力。
评估方面的关键提案包括:
- Disclosure Requirements: AI 公司应被要求向监管机构披露评估方法和结果,但不一定需要向公众披露,以保护知识产权(IP)和机密信息。
- Industry Standards: 政府机构,特别是美国国家标准与技术研究院(NIST),应与行业合作,建立评估模型能力、局限性和风险的最佳实践和基准。
Risk-Responsive Assessments and Thresholds
为了确保监管措施与模型带来的风险成正比,Anthropic 建议开发针对关键风险(如自主性和欺骗性)的标准能力评估。
该框架建议采用基于风险的部署流程:
- Risk Threshold Establishment: 研究和资金应被用于定义一个特定的风险阈值。
- Below Threshold: 模型若低于该阈值,在验证其符合现有安全标准后即可部署。
- Above Threshold: 对于超过风险阈值且缺乏足够安全缓解措施的模型,必须停止其部署,加强监管,并通知监管机构以确定必要的保障措施。
Pre-registration of Large Training Runs
Anthropic 建议建立一个机密注册表,供 AI 开发商在训练开始前向其国家政府预先注册大规模训练任务的详细信息。该注册表将追踪:
- 模型规格和类型
- 计算基础设施
- 预期训练完成日期
- 安全计划
这一过程旨在确保监管机构在模型创建之前就已获知潜在风险,同时通过高标准的网络安全和隐私标准来保护汇总数据。
External Auditing and Red Teaming
为了验证安全声明,Anthropic 建议强制执行外部红队测试(red teaming)并授权第三方审计员。
Third-Party Auditor Requirements
审计员必须具备以下三个特定特征才能发挥作用:
- Technical Literacy: 深度机器学习经验。
- Security Consciousness: 保护可能构成国家安全威胁的敏感 IP 的能力。
- Flexibility: 进行轻量级评估的能力,以便在识别威胁的同时不阻碍美国竞争力。
External Red Teaming
外部红队测试应成为发布先进 AI 系统的前置条件。Anthropic 建议通过 NIST 等中央机构或通过研究人员 API 访问的去中心化方式进行管理。公司强调,在将其变为强制要求之前,必须先建立高质量的红队测试方案,因为目前所需的人才主要集中在私营实验室中。
Interpretability and Industry Collaboration
Anthropic 主张通过政府向大学、非营利组织和公司提供资助,增加对可解释性研究的资金投入。这使得安全工作可以在前沿实验室之外的小型模型上进行。
此外,该提案还解决了两个系统性障碍:
- Regulatory Feasibility: Anthropic 指出,目前要求模型完全可解释是不可行的,但随着研究的进展,可能会变得可行。
- Antitrust Clarity: 监管机构应就 AI 公司如何在维护公共利益的同时在安全方面进行协作而不违反反垄断法提供明确的指导,以减少行业协作的法律不确定性。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch