promptfoo/promptfoo

Test your prompts, agents, and RAGs. Red teaming/pentesting/vulnerability scanning for AI. Compare performance of GPT, Claude, Gemini, DeepSeek, and more. Simple declarative configs with command line and CI/CD integration. Used by OpenAI and Anthropic.

What it solves

LLM アプリケーション開発における試行錯誤を排除し、プロンプトの性能を体系的に評価し、リリース前にセキュリティ脆弱性を特定します。

How it works

Promptfoo は CLI とライブラリで、開発者が自動評価とレッドチーミングを実行できます。OpenAI、Anthropic、Azure、Bedrock、Ollama などの異なるプロンプトとモデルを横並びで比較でき、CI/CD パイプラインに組み込んで自動チェックやコードスキャンによるセキュリティ・コンプライアンス問題の検出が可能です。

Who it’s for

LLM を活用したアプリケーションを構築する開発者向けで、AI アプリのモデル選択とプロンプト設計において安全性・信頼性・データ駆動を実現したい方に最適です。

Highlights

  • Automated Evaluations: プロンプトとモデルを体系的にテスト。
  • Red Teaming: 脆弱性をスキャンして LLM アプリを保護。
  • Model Comparison: 複数の LLM プロバイダーを横並びで比較。
  • Developer-First: ライブリロード、キャッシュ、ローカル実行などプライバシー重視の機能を搭載。
  • CI/CD Integration: コードスキャンで自動チェックとプルリクエストのレビューを実現。