Anthropic 扩大模型安全漏洞赏金计划

TL;DR

Anthropic 宣布了一项扩大的、仅限受邀参加的漏洞赏金计划,旨在奖励发现其下一代 AI 安全缓解措施中通用越狱攻击的行为,奖励金额最高可达 15,000 美元,目标是保护 CBRN 和网络安全等高风险领域。

Program Overview

Anthropic 正在启动一项新的漏洞赏金计划,重点关注通用越狱攻击——即在许多主题上都能一致性地绕过 AI 安全护栏的漏洞利用。该计划针对的是可能影响化学、生物、放射性及核(CBRN)威胁和网络安全等关键、高风险领域的漏洞。

How the Initiative Works

  • Early Access: 被选中的参与者将获得 Anthropic 最新安全缓解系统的预发布访问权限,从而允许他们在受控环境中测试其弱点。
  • Scope and Rewards: 对于可能危害高风险领域的创新型通用越狱攻击,将提供高达 15,000 美元的赏金。如果一个越狱攻击能够使模型在不同主题上回答一组定义的有害问题,则该攻击被视为通用越狱。
  • Evaluation Process: 将向参与者提供详细的指令和反馈。提交的内容将根据新颖性和影响进行评估,并承诺在仅限受邀阶段提供及时、建设性的反馈。

Eligibility and Application

初始阶段是仅限受邀参加的,并与 HackerOne 合作开展。在 AI 安全或语言模型越狱方面拥有成熟经验的研究人员可以通过 application formFriday, August 16 前提交申请。入选的申请人将在秋季收到参与邀请。

Ongoing Reporting Mechanism

Anthropic 继续接受其当前部署模型的安全问题报告。研究人员可以将详细的发现发送邮件至 usersafety@anthropic.com。公司参考其 Responsible Disclosure Policy 以获取指导。

Alignment with Global AI Safety Commitments

该赏金计划支持 Anthropic 在白宫 Voluntary AI Commitments 和 G7 Code of Conduct for Organizations Developing Advanced AI Systems 下的承诺。通过专注于通用越狱缓解措施,Anthropic 旨在确保安全措施的演进与快速发展的 AI 能力同步。

Related Announcements

  • Improving Fable 5's biology safeguards – 参见相关公告以了解有关特定领域安全增强措施的详情。
  • Mariano-Florentino (Tino) Cuéllar joins Anthropic as Chief Global Affairs Officer – 一项与公司全球政策参与相关的领导层更新。

Sources

相关