Anthropic 提议的 AI 开发透明度框架
Anthropic 提议了一项针对性的透明度框架,旨在确保最强大的 AI 系统开发者的公共安全和问责制。该框架旨在在政府、学术界和工业界制定全球安全标准和全面评估方法期间,提供一种过渡性的安全措施。
AI 监管的灵活方式
提议的框架旨在保持轻量化和灵活性,以避免阻碍 AI 创新或减缓国家安全、公共利益和药物研发等领域的收益交付。Anthropic 认为,僵化的、政府强加的标准可能会适得其反,因为由于技术变革的快速步伐,AI 评估方法往往在几个月内就会过时。
AI 透明度的最低标准
Anthropic 概述了六项核心原则,这些原则应指导 AI 透明度政策,以在适应技术不断演进的特性的同时,增强安全性并保障公共安全:
1. 针对大型开发者的针对性应用
透明度要求应仅适用于最大的前沿模型开发者。这些开发者的特征在于与计算能力、计算成本、评估性能、年收入和研发投入相关的阈值。为了保护初创企业生态系统,该框架建议对较小的开发者进行豁免。潜在阈值的示例包括年收入约为 1 亿美元或年度研发和资本支出约为 10 亿美元。
2. 安全开发框架的实施
受监管的开发者必须建立安全开发框架,以评估和缓解“不合理的风险”。这些风险特别包括由模型自主性失调引起的危害,以及制造化学、生物、放射性及核(CBRN)危害。
3. 安全框架的公开披露
安全开发框架必须在 AI 公司维护的面向公众的网站上进行披露,并允许对敏感信息进行合理的脱敏处理。公司还必须提供一份自我认证,证明其正在遵守其发布的框架条款。
4. 系统卡片的发布
开发者必须在部署时公开披露系统卡片(system cards)或类似的文档。这些文档应总结测试程序、评估结果和缓解措施,并允许对可能损害模型或公众安全与保障的信息进行脱敏处理。
5. 举报人的法律保护
为了确保问责制,该框架提议将实验室对其自身框架的合规性撒谎定为违法行为。这将使现有的举报人保护机制能够适用,并将执法重点放在蓄意的不当行为上。
6. 演进式透明度标准
由于 AI 安全和安全实践仍处于早期阶段,框架必须设计为可演进的。要求应从灵活、轻量级的标准开始,随着利益相关者之间达成共识的最佳实践出现而不断调整。
行业背景与政策影响
该提议与领先实验室已采用的现有自愿实践相一致,包括 Anthropic 的 Responsible Scaling Policy 以及来自 Google DeepMind、OpenAI 和 Microsoft 的类似框架。通过将这些要求编纂成法律,该框架将使行业最佳实践标准化,并确保随着模型变得更加强大,安全披露不会被撤回。
Anthropic 建议,这些针对系统卡片和安全开发框架的透明度要求将为政策制定者提供必要的证据,以判断是否需要进一步、更严格的监管,同时为公众提供有关前沿 AI 技术的重要信息。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch