Hugging Face RiskRubric.ai 公告

Hugging Face 已宣布推出 RiskRubric.ai,一個標準化的風險評估平台,旨在為 AI 模型領域提供一致且可比較的風險分數。此計畫由雲端安全聯盟(Cloud Security Alliance)與 Noma Security 主導,並有 Haize Labs 與 Harmonic Security 的貢獻,目標是透過提供開發者系統化的方式來評估模型的安全姿態、隱私影響與潛在失效模式,讓 AI 安全民主化。

標準化風險評估框架

RiskRubric.ai 依據六大核心支柱來評估模型:透明度、可靠性、安全性、隱私、安全與聲譽。為確保評估可重現且透明,平台利用 Noma Security 的能力自動化以下測試:

  • 可靠性: 超過 1,000 項測試,檢查一致性與邊緣案例處理。
  • 安全性: 超過 200 項對抗性安全探測,針對 jailbreak 與提示注入。
  • 自動程式碼掃描: 分析模型組件。
  • 文件審查: 全面審查訓練資料與方法。
  • 文件審查: 全面審查訓練資料與方法。
  • 隱私: 包括洩漏測試與資料保留評估。
  • 安全: 結構化測試有害內容。

每個支柱會被賦予 0‑100 的分數,然後轉換為字母等級(A‑F)。平台會提供發現的具體漏洞、建議的緩解措施與改進建議,讓開發者能根據特定需求(例如醫療應用的高隱私分數)篩選模型。

2025 年 9 月資料的關鍵發現

使用這些標準對開放與封閉模型進行評估,揭示了 AI 風險領域的幾項關鍵趨勢:

風險分布與兩極化

總風險分數介於 47 到 94 之間,中位數為 81。雖然 54% 的模型被評為 A 或 B 級,但仍有長尾的表現不佳模型。分數落在 50‑67(C/D 範圍)的模型僅提供中等至低等的整體保護,這是安全漏洞的關鍵關注領域。

安全性與安全性的相關性

安全與社會支柱在模型間的變異最大。資料顯示,具備強化安全硬化(如提示注入防禦與政策執行)的模型,在安全性評分上始終較高。這暗示安全性往往是強大安全姿態的副產品。

透明度‑安全性的取捨

更嚴格的防護常會導致透明度下降,模型可能在未提供說明的情況下拒絕請求。為在不犧牲安全的前提下維持信任,平台建議將強化的防護與可稽核性、來源訊號以及具說明性的拒絕結合使用。

社群驅動的改進

RiskRubric.ai 鼓勵社群透過提交模型進行評估或提供評估方法的回饋來參與。透過將風險評估公開且標準化,社群能辨識模型需要加強的地方,並貢獻修補、補丁與更安全的微調變體,形成良性循環的改進。

Sources