Hugging Face RiskRubric.ai 公告
Hugging Face 宣布了 RiskRubric.ai,这是一款标准化的风险评估平台,旨在为整个 AI 模型生态系统提供一致且可比较的风险分数。该倡议由云安全联盟(Cloud Security Alliance)和 Noma Security 主导,Haize Labs 与 Harmonic Security 共同贡献,旨在通过为开发者提供系统化的方法来评估模型的安全姿态、隐私影响以及潜在的失效模式,从而实现 AI 安全的民主化。
标准化风险评估框架
RiskRubric.ai 基于六大核心支柱对模型进行评估:透明性、可靠性、安全性、隐私、安全性和声誉。为确保评估可复现且透明,平台利用 Noma Security 的能力自动化以下测试:
- 可靠性: 超过 1,000 项测试,检查一致性和边缘案例处理。
- 安全性: 超过 200 项对抗性安全探针,针对 jailbreak 和提示注入进行测试。
- 自动化代码扫描: 对模型组件进行分析。
- 文档审查: 对训练数据和方法进行全面审查。
- 文档审查: 对训练数据和方法进行全面审查。
- 隐私: 包括泄漏测试和数据保留评估。
- 安全性: 对有害内容进行结构化测试。
每个支柱都会得到 0‑100 的分数,随后转换为字母等级(A‑F)。平台会提供发现的具体漏洞、推荐的缓解措施以及改进建议,使开发者能够根据特定需求(例如医疗应用对高隐私分数的要求)筛选模型。
2025 年 9 月数据的关键发现
使用这些标准对开源和闭源模型进行评估,揭示了 AI 风险格局的若干关键趋势:
风险分布与两极分化
总体风险分数范围为 47 到 94,中央値为 81。虽然 54% 的模型被评为 A 或 B 级,但仍存在一长尾的表现不佳模型。分数位于 50‑67(C/D 区间)的模型仅提供中等至低水平的整体防护,构成安全漏洞的关键关注点。
安全性与安全性的相关性
安全性与社会影响支柱在模型之间的差异最大。数据表明,具备强安全加固(如提示注入防御和策略执行)的模型在安全性评分上始终更高。这暗示安全性往往是强大安全姿态的副产品。
透明性‑安全性权衡
更严格的防护措施常导致透明性下降,因为模型可能在没有解释的情况下拒绝请求。为在不牺牲安全的前提下保持信任,平台建议将强防护与可审计性、来源追溯信号以及可解释的拒绝相结合。
社区驱动的改进
RiskRubric.ai 鼓励社区通过提交模型进行评估或对评估方法提供反馈来参与其中。通过将风险评估公开且标准化,社区能够识别模型需要加强的地方,并贡献修复、补丁以及更安全的微调变体,形成良性循环的改进过程。