promptfoo/promptfoo
Test your prompts, agents, and RAGs. Red teaming/pentesting/vulnerability scanning for AI. Compare performance of GPT, Claude, Gemini, DeepSeek, and more. Simple declarative configs with command line and CI/CD integration. Used by OpenAI and Anthropic.
What it solves
LLM 애플리케이션 개발 시 시행착오 방식을 대체하고, 프롬프트 성능을 체계적으로 평가하며, 프로덕션에 배포하기 전에 보안 취약점을 식별합니다.
How it works
Promptfoo는 CLI와 라이브러리로, 개발자가 자동화된 평가와 레드팀 연습을 실행할 수 있게 합니다. OpenAI, Anthropic, Azure, Bedrock, Ollama 등 다양한 프롬프트와 모델을 나란히 비교할 수 있으며, CI/CD 파이프라인에 통합해 자동 검사와 코드 스캔을 통해 보안 및 컴플라이언스 문제를 감지합니다.
Who it’s for
LLM 기반 애플리케이션을 구축하는 개발자를 위한 것으로, AI 앱의 모델 선택과 프롬프트 엔지니어링에서 보안·신뢰성·데이터 기반 접근을 보장하고자 하는 경우에 적합합니다.
Highlights
- Automated Evaluations: 프롬프트와 모델을 체계적으로 테스트합니다.
- Red Teaming: 취약점을 스캔해 LLM 앱을 보호합니다.
- Model Comparison: 여러 LLM 제공자를 나란히 비교합니다.
- Developer-First: 라이브 리로드, 캐싱, 로컬 실행 등 프라이버시 중심 기능을 포함합니다.
- CI/CD Integration: 코드 스캔을 통한 자동 검사와 풀 리퀘스트 리뷰를 구현합니다.