promptfoo/promptfoo

Test your prompts, agents, and RAGs. Red teaming/pentesting/vulnerability scanning for AI. Compare performance of GPT, Claude, Gemini, DeepSeek, and more. Simple declarative configs with command line and CI/CD integration. Used by OpenAI and Anthropic.

它解决的问题

它通过提供评估、测试和保护提示与模型的系统化方式,消除了开发 LLM 应用程序时的试错方法。它帮助开发者在发布到生产环境之前,确保他们的 AI 应用程序可靠、安全且符合规范。

它是如何工作的

Promptfoo 是一个 CLI 和库,允许开发者运行自动评估和红队演练。它能够对不同的 LLM 提供者(例如 OpenAI、Anthropic、Azure、Bedrock 和 Ollama)进行并排比较,并集成到 CI/CD 管道中以进行自动检查。它还包括代码扫描,以审查拉取请求中的安全和合规问题。

它适合谁使用

它专为构建 LLM 驱动应用程序的开发者设计,他们需要从凭感觉的决策转向用于提示工程和安全测试的数据驱动指标。

亮点

  • 自动评估:以结构化方式测试提示和模型。
  • 红队测试:扫描漏洞以保护 LLM 应用程序。
  • 模型比较:并排比较多个 LLM 提供者。
  • CI/CD 集成:在开发管道中自动化质量和安全检查。
  • 本地执行:评估在本地运行以保持提示私密。
  • 代码扫描:审查拉取请求中的 LLM 相关安全与合规问题。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目