stevibe/BenchLocal
Test LLMs on real tasks. Compare models side-by-side.
何を解決するか
BenchLocal は、実世界のタスク上で大規模言語モデル(LLM)をテスト・比較するためのローカル優先のデスクトップ環境を提供します。ユーザーが複数のローカルまたはリモートモデルに対して標準化された「Bench Packs」(ベンチマークセット)を並列で実行できるようにすることで、モデルの手動テストの煩わしさを解消します。
動作方法
このソフトウェアは、プロバイダ設定、モデルレジストリ、ベンチマークの実行を管理する共有デスクトップランタイムとして機能します。ユーザーは、シナリオ定義、プロンプト、スコアリングロジックを含む Bench Packs をインストールし、アプリで実行します。システムはタブ単位のサンプリングオーバーライドをサポートし、実行結果の履歴を保持します。
さらに、HTTP API と Model Context Protocol (MCP) を通じた「エージェントアクセス」機能により、AIエージェントや自動化ツールがUIがアクティブな状態でもベンチマークワークフローをプログラムで制御できます。
対象ユーザー
特定のタスク(ツール呼び出し、バグ検出、データ抽出など)におけるLLMのパフォーマンスを、異なるモデル間で一貫したフレームワークで評価したい開発者やAI研究者向けに設計されています。
主な特徴
- ローカル優先のデスクトップアプリ:LLMベンチマークの管理と実行に特化した環境。
- Bench Packシステム:インストール可能でモジュール化されたベンチマークセットをサポートし、独自のスコアリングと検証ロジックを備える。
- エージェント制御:MCP と OpenAPI との統合により、外部AIエージェントが実行やモデルを管理可能。
- 並列比較:同じタスクに対して複数のモデルの出力を同時に比較可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト