braintrustdata/autoevals

AutoEvals is a tool for quickly and easily evaluating AI model outputs using best practices.

何を解決するか

Autoevals は、AI モデルの出力を評価するための統合インターフェースを提供し、一般的な評価メトリクスを手動で実装する必要をなくします。スコアの正規化(0 から 1 の間でスケーリング)や、モデルによるスコア付け出力の解析を簡素化しており、実際の開発ではデバッグや調整が難しい場合が多いです。

動作方法

このライブラリは、入力、出力、期待される値を受け取りスコアを生成する評価手法の複数のカテゴリを統合しています。

  • LLM-as-a-judge: 要素の正確性、安全性、要約など、主観的なタスクをモデルを使って評価します。
  • RAG 評価: コンテキストの精度、再現率、忠実性など、リトリーブ増強生成(RAG)に特化したメトリクス。
  • ヒューリスティックおよび統計的: レーベンシュタイン距離、BLEU、正確一致など、従来のメトリクス。
  • カスタムスコアラー: ユーザーはカスタムプロンプトを使用した独自の LLM クラスファイアや、LLM を使わないスコアリング関数を定義できます。

OpenAI互換 API または Braintrust Gateway を通じて、複数の AI プロバイダーをサポートしており、キャッシュや観測性も提供します。

対象ユーザー

モデルのパフォーマンスを定量的に測定し、プロンプトや RAG パイプラインを改善したい AI アプリケーション開発者。

特徴

  • 多言語対応: Python と TypeScript の両方で利用可能。
  • 統合インターフェース: 異なる評価方法にわたって一貫した API を提供。
  • 拡張性: カスタムモデル評価やシンプルなヒューリスティックスコアラーを簡単に作成可能。
  • 広範なメトリクスセット: RAG、一般的な LLM タスク、埋め込み類似度など、多数の事前構築済みスコアラーを含む。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト