Anthropic 擴大模型安全漏洞賞金計畫
TL;DR
Anthropic 宣布擴大一項僅限受邀參加的漏洞賞金計畫,若發現其下一代 AI 安全緩解措施中的通用越獄攻擊,最高可獲得 15,000 美元的獎勵,旨在保護 CBRN 和網路安全等高風險領域。
計畫概述
Anthropic 正推出一項新的漏洞賞金倡議,專注於通用越獄攻擊——即在多個主題中都能一致地繞過 AI 安全護欄的漏洞利用。該計畫針對可能影響化學、生物、放射性及核能 (CBRN) 威脅和網路安全等關鍵高風險領域的漏洞。
倡議運作方式
- 早期存取權:獲選的參與者將獲得 Anthropic 最新安全緩解系統的預發布存取權,使其能夠在受控環境中測試弱點。
- 範圍與獎勵:針對可能危害高風險領域的新穎通用越獄攻擊,提供最高 15,000 美元的賞金。如果一個越獄攻擊能讓模型回答一系列定義好的有害問題(跨越不同主題),則該攻擊被視為通用越獄。
- 評估流程:將向參與者提供詳細的說明與回饋。提交的內容將根據新穎性與影響力進行評估,並承諾在僅限受邀階段提供及時且具建設性的回饋。
資格與申請
初始階段為僅限受邀參加,並與 HackerOne 合作進行。在 AI 安全或語言模型越獄方面具有證明經驗的研究人員可以透過 application form 於 **2025 年 8 月 16 日(星期五)**前提出申請。獲選的申請者將在秋季收到參與通知。
持續性的報告機制
Anthropic 持續接受其目前部署模型的安全問題報告。研究人員可以將詳細發現透過電子郵件發送至 usersafety@anthropic.com。公司參考其 Responsible Disclosure Policy 以作為指導。
與全球 AI 安全承諾的對齊
該賞金計畫支持 Anthropic 在白宮 Voluntary AI Commitments 以及 G7 Code of Conduct for Organizations Developing Advanced AI Systems 下的承諾。透過專注於通用越獄緩解措施,Anthropic 旨在確保安全措施能與快速進步的 AI 能力同步演進。
相關公告
- Improving Fable 5's biology safeguards – 參閱連結的公告以了解領域特定安全增強措施的詳細資訊。
- Mariano-Florentino (Tino) Cuéllar joins Anthropic as Chief Global Affairs Officer – 一項與公司全球政策參與相關的領導層更新。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch