Giskard-AI/giskard-oss

🐢 Open-Source Evaluation & Testing library for LLM Agents

何を解決するか

Giskard は、AIエージェントやLLMベースのシステムの非決定性の性質に対処するように設計されており、従来のユニットテストでは不十分な状況に対応します。このフレームワークにより、これらのシステムのテスト、評価、レッドチーム演習が可能になり、リグレッションの検出、RAG(リトリーブ・オーギュメント・ジェネレーション)の品質の検証、敵対的攻撃に対する安全性とセキュリティの確保が実現します。

動作方法

プロジェクトはモジュール型パッケージに構成されています:

  • Giskard Checks: 「ターゲット」(テスト対象システム)、「シナリオ」(インタラクションとチェック)、「チェック」(アサーションまたはLLM-as-judge評価)を使用して評価(evals)を作成するためのライブラリ。マルチターン会話と、根拠の有無および整合性を評価するための組み込みジャッジをサポートします。
  • Giskard Scan: プレーンテキストによるエージェントの説明に基づいて、自動的に敵対的テストスイートを生成するレッドチーム層。プロンプトインジェクション、有害なコンテンツ、誤情報などの脆弱性を標的とし、OWASP LLM Top-10の脅威をカバーします。
  • ファウンデーションライブラリ: giskard-coregiskard-llm(プロバイダに依存しないルーティング)、giskard-agents(オーケストレーション)は、基盤インフラを提供します。

対象ユーザー

LLMベースのエージェント、RAGパイプライン、マルチステップAIワークフローを構築する開発者やAIエンジニアで、展開前にシステムの堅牢性、安全性、信頼性を確保したい方。

主な特徴

  • LLM-as-Judge: LLMを用いてエージェントの応答の品質と根拠の有無を評価します。
  • 自動レッドチーム演習: 敵対的入力を自動生成し、脆弱性やプロンプトインジェクションを探査します。
  • モジュールアーキテクチャ: 軽量なパッケージで、任意の同期/非同期コール可能な関数をターゲットとしてラップできます。
  • RAG評価: 知識ベースの品質と根拠の有無を評価するための専用ツールを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト