promptfoo/promptfoo
Test your prompts, agents, and RAGs. Red teaming/pentesting/vulnerability scanning for AI. Compare performance of GPT, Claude, Gemini, DeepSeek, and more. Simple declarative configs with command line and CI/CD integration. Used by OpenAI and Anthropic.
What it solves
LLM アプリケーション開発における試行錯誤を排除し、プロンプトの性能を体系的に評価し、リリース前にセキュリティ脆弱性を特定します。
How it works
Promptfoo は CLI とライブラリで、開発者が自動評価とレッドチーミングを実行できます。OpenAI、Anthropic、Azure、Bedrock、Ollama などの異なるプロンプトとモデルを横並びで比較でき、CI/CD パイプラインに組み込んで自動チェックやコードスキャンによるセキュリティ・コンプライアンス問題の検出が可能です。
Who it’s for
LLM を活用したアプリケーションを構築する開発者向けで、AI アプリのモデル選択とプロンプト設計において安全性・信頼性・データ駆動を実現したい方に最適です。
Highlights
- Automated Evaluations: プロンプトとモデルを体系的にテスト。
- Red Teaming: 脆弱性をスキャンして LLM アプリを保護。
- Model Comparison: 複数の LLM プロバイダーを横並びで比較。
- Developer-First: ライブリロード、キャッシュ、ローカル実行などプライバシー重視の機能を搭載。
- CI/CD Integration: コードスキャンで自動チェックとプルリクエストのレビューを実現。