promptfoo/promptfoo
Test your prompts, agents, and RAGs. Red teaming/pentesting/vulnerability scanning for AI. Compare performance of GPT, Claude, Gemini, DeepSeek, and more. Simple declarative configs with command line and CI/CD integration. Used by OpenAI and Anthropic.
何を解決するか
LLM アプリケーションの開発における試行錯誤のアプローチを、プロンプトとモデルを評価・テスト・保護する体系的な方法を提供することで排除します。これにより、開発者は本番環境にリリースする前に、AI アプリが信頼性が高く、安全で、コンプライアンスに適合していることを確認できます。
どのように機能するか
Promptfoo は、開発者が自動評価とレッドチーム演習を実行できる CLI とライブラリです。異なる LLM プロバイダー(OpenAI、Anthropic、Azure、Bedrock、Ollama など)の横並び比較を可能にし、CI/CD パイプラインに統合して自動チェックを行います。また、プルリクエストのセキュリティとコンプライアンス問題をレビューするコードスキャンも含まれます。
誰のためのツールか
LLM を活用したアプリケーションを開発する開発者向けに設計されており、感覚に頼る意思決定から、プロンプトエンジニアリングとセキュリティテストのためのデータ駆動型の指標へ移行する必要がある方に適しています。
ハイライト
- 自動評価:構造化されたアプローチでプロンプトとモデルをテストします。
- レッドチーム:脆弱性をスキャンして LLM アプリケーションを保護します。
- モデル比較:複数の LLM プロバイダーを横並びで比較します。
- CI/CD 統合:開発パイプラインで品質とセキュリティチェックを自動化します。
- ローカル実行:評価はローカルで実行され、プロンプトをプライベートに保ちます。
- コードスキャン:LLM 関連のセキュリティとコンプライアンス問題についてプルリクエストをレビューします。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト