promptfoo/promptfoo

Test your prompts, agents, and RAGs. Red teaming/pentesting/vulnerability scanning for AI. Compare performance of GPT, Claude, Gemini, DeepSeek, and more. Simple declarative configs with command line and CI/CD integration. Used by OpenAI and Anthropic.

무엇을 해결하는가

LLM 애플리케이션 개발에서의 시행착오 접근 방식을, 프롬프트와 모델을 평가, 테스트, 보안하는 체계적인 방법을 제공함으로써 제거합니다. 이를 통해 개발자는 프로덕션에 배포하기 전에 AI 앱이 신뢰할 수 있고, 안전하며, 규정을 준수하는지 확인할 수 있습니다.

어떻게 작동하는가

Promptfoo는 개발자가 자동 평가 및 레드팀 연습을 실행할 수 있는 CLI 및 라이브러리입니다. OpenAI, Anthropic, Azure, Bedrock, Ollama 등과 같은 다양한 LLM 제공자를 나란히 비교할 수 있으며, CI/CD 파이프라인에 통합되어 자동 검사를 수행합니다. 또한 보안 및 규정 준수 문제를 검토하기 위해 풀 리퀘스트의 코드 스캔을 포함합니다.

누구를 위한 도구인가

LLM 기반 애플리케이션을 구축하는 개발자를 위해 설계되었으며, 직감에 의존하는 결정에서 프롬프트 엔지니어링과 보안 테스트를 위한 데이터 기반 지표로 전환해야 하는 경우에 적합합니다.

주요 기능

  • 자동 평가: 구조화된 방식으로 프롬프트와 모델을 테스트합니다.
  • 레드팀: 취약점을 스캔하여 LLM 애플리케이션을 보호합니다.
  • 모델 비교: 여러 LLM 제공자를 나란히 비교합니다.
  • CI/CD 통합: 개발 파이프라인에서 품질 및 보안 검사를 자동화합니다.
  • 로컬 실행: 평가는 로컬에서 실행되어 프롬프트를 비공개로 유지합니다.
  • 코드 스캔: LLM 관련 보안 및 규정 준수 문제를 위해 풀 리퀘스트를 검토합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트