tophant-ai/aibeat

Break your AI before they do. Join Discord: https://discord.gg/8A6mFckxZ

解決的問題

AI Beat 為生成式 AI 提供了一個安全評估框架,專注於識別 LLM、RAG 應用與 AI 代理中的安全邊界與漏洞。它超越了簡單的評分機制,提供基於證據的結果,能夠區分看似安全的最終答案與潛在不安全的執行路徑(例如:代理在提供安全回應的同時,將憑證洩漏至暫存檔案中)。

工作原理

此專案包含兩個主要工具:

  • PromptBeat:一個黑箱評估引擎,透過模擬攻擊者與裁判來測試 LLM、API 與 RAG 應用的行為與安全性。
  • AgentBeat:一個擴充工具,用於對代理執行時進行儀器化評估。它收集執行時證據,包括工具呼叫、指令、檔案變更與追蹤事件,以判斷代理在執行過程中是否越過安全邊界。

兩個工具共享相同的場景、案例與報告模型。AgentBeat 使用適配器,透過語言無關的清單檔與特定 HTTP 協定連接到代理執行時。

適用對象

專為需要嚴格測試其 AI 系統安全性與安全性的開發者與安全研究人員設計,尤其適用於部署具備工具存取權限的自主代理的場景。

主要亮點

  • 基於證據的評估:捕獲追蹤記錄、環境變更與檔案實體,以證明安全失敗。
  • 對稱的工作流程:在黑箱(PromptBeat)與執行時儀器化(AgentBeat)測試中,均使用共享的場景與報告模型。
  • 多角色架構:支援攻擊者、裁判與目標模型的獨立角色,避免偏差。
  • 可擴展的適配器系統:透過類型化 SDK 與基於清單的註冊,支援與多種代理執行時的整合。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案