stanford-crfm/helm
Holistic Evaluation of Language Models (HELM) is an open source Python framework created by the Center for Research on Foundation Models (CRFM) at Stanford for holistic, reproducible and transparent evaluation of foundation models, including large language models (LLMs) and multimodal models.
何を解決するか
HELMは、基礎モデルの評価を標準化、透明性、再現可能性のある方法で提供します。異なるモデルやベンチマーク間での評価の不整合という問題に対処し、正確性、バイアス、毒性、効率性など、複数の次元にわたるモデル性能の包括的な視点を可能にします。
どう動くか
HELMは、包括的な評価パイプラインを構築するために複数のコンポーネントを統合するPythonフレームワークです。
- 統一インターフェース: OpenAI、Anthropic、Googleなど、さまざまなプロバイダーのモデルに一貫した方法でアクセスできます。
- 標準化されたベンチマーク: MMLU-Pro、GPQA、IFEvalなど、幅広いデータセットとベンチマークを標準フォーマットで提供します。
- 多次元メトリクス: 単純な正確性を超えたメトリクス(効率性、バイアス、毒性など)を使用して性能を測定します。
- 可視化ツール: 個々のプロンプトと応答を検査するためのWeb UIと、モデル間での結果比較用のWebリーダーボードを備えています。
対象ユーザー
LLMおよびマルチモーダルモデルの再現可能で透明な評価を必要とする研究者や開発者、また標準化されたベンチマーク上でモデル性能を比較したい人向けです。
特徴
- 包括的なアプローチ: 正確性、バイアス、毒性、効率性など、複数のメトリクスでモデルを評価します。
- 広範なモデル対応: 主要AIプロバイダーの複数モデルを統一インターフェースで扱えます。
- 豊富なベンチマークライブラリ: 医療、金融、視覚言語タスクなど、さまざまな分野をカバーします。
- 統合型可視化: 結果分析用に組み込みWebサーバーとリーダーボードを備えています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch