promptfoo/promptfoo

Test your prompts, agents, and RAGs. Red teaming/pentesting/vulnerability scanning for AI. Compare performance of GPT, Claude, Gemini, DeepSeek, and more. Simple declarative configs with command line and CI/CD integration. Used by OpenAI and Anthropic.

它解決的問題

它透過提供評估、測試和保護提示詞與模型的系統化方式,消除了開發 LLM 應用程式時的試誤方法。它幫助開發者在發布到生產環境之前,確保他們的 AI 應用程式可靠、安全且符合規範。

它是如何運作的

Promptfoo 是一個 CLI 和函式庫,允許開發者執行自動評估和紅隊演練。它能夠進行不同 LLM 提供者(例如 OpenAI、Anthropic、Azure、Bedrock 和 Ollama)的並排比較,並整合到 CI/CD 管線中以進行自動檢查。它也包含程式碼掃描,以檢查拉取請求中的安全與合規問題。

它適合誰使用

它專為開發 LLM 驅動應用程式的開發者設計,他們需要從憑感覺的決策轉向用於提示詞工程和安全測試的資料驅動指標。

主要特點

  • 自動評估:以結構化方式測試提示詞和模型。
  • 紅隊測試:掃描漏洞以保護 LLM 應用程式。
  • 模型比較:並排比較多個 LLM 提供者。
  • CI/CD 整合:在開發管線中自動化品質與安全檢查。
  • 本地執行:評估在本地執行以保持提示詞私密。
  • 程式碼掃描:檢查拉取請求中的 LLM 相關安全與合規問題。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案