whitzard-ai/jade-db

"他山之石、可以攻玉":复旦JADE团队发布的大模型测评与治理系列

解決的問題

JADE 解決了評估大型語言模型(LLMs)安全防護機制的挑戰。它特別解決了「低觸發率」問題——標準安全測試往往無法繞過模型的安全過濾器——透過生成有針對性的高風險測試資料集,有效探測模型對齊中的漏洞。

工作原理

該平台使用語言變異技術,自動將低觸發率的「種子問題」轉化為高風險問題。這些變異生成的文本自然流暢,更可能繞過安全過濾器。生成的資料集涵蓋四大主要類別:核心價值、非法活動、權利侵犯和歧視/偏見,涵蓋超過30個子類別。

適用對象

專為需要嚴格測試 LLM、多模態模型和 AI 代理安全對齊的 AI 研究人員、開發者和安全審計人員設計,確保它們不會產生有害或非法內容。

主要亮點

  • 語言變異:從簡單種子自動生成高風險提示,以更好地測試模型韌性。
  • 全面覆蓋:涵蓋中文和英文模型在各類安全領域(如非法行為、隱私侵犯和偏見)的資料集。
  • 多版本基準:提供不同難度層級,包括 Easy、Medium 和高風險(跨模型可遷移)資料集。
  • 擴展生態系統:包含針對電話代理(Jade-BadPhoneAgent)、多模態幻覺(Jade-HAL)和推理鏈安全(Jade-LRMGuard)的專用工具。

相關

  • 專案
  • 專案
  • 專案
  • Dispatch
  • Dispatch