UKGovernmentBEIS/inspect_ai

Inspect: A framework for large language model evaluations

何を解決するか

Inspect は、大規模言語モデル(LLM)を評価するためのフレームワークです。モデルが期待通りに動作することを確認し、潜在的なセキュリティやパフォーマンスの課題を特定するための標準化されたテスト方法を提供します。

動作方法

このフレームワークは、プロンプト工学、マルチターン対話、ツール使用のための組み込みコンポーネントを提供します。また、モデルによるスコアリング(モデルが他のモデルのパフォーマンスを評価する)をサポートしています。システムは拡張可能で、他のPythonパッケージが新しいスコアリング手法や誘導方法を提供できるようになっています。

対象ユーザー

このツールは、AI研究者、セキュリティ監査担当者、LLMの能力を厳密にテスト・評価する必要がある開発者に主に向けられています。

特徴

  • 任意のモデルで即座に実行可能な200以上の事前構築済み評価。
  • マルチターン対話とツール使用のテストをサポート。
  • モデルによるスコアリングをサポート。
  • Pythonパッケージによる拡張可能なアーキテクチャ。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト