stevibe/BenchLocal

Test LLMs on real tasks. Compare models side-by-side.

解決的問題

BenchLocal 提供一個以本地為先的桌面環境,用於在真實任務中測試與比較大型語言模型(LLMs)。它允許使用者並行執行標準化的「Bench Packs」(基準測試集),對多個本地或遠端模型進行比較,從而消除手動測試模型的繁瑣過程。

如何運作

此軟體扮演共享的桌面執行環境,管理提供者設定、模型註冊表以及基準測試的執行。使用者安裝 Bench Packs(包含情境定義、提示與評分邏輯),並透過應用程式執行。系統支援每一個標籤頁的取樣覆蓋,並保留執行結果的歷史紀錄。

此外,它透過 HTTP API 與 Model Context Protocol (MCP) 提供「代理存取」功能,讓 AI 代理與自動化工具能在 UI 保持活躍狀態時,以程式化方式控制基準測試工作流程。

適用對象

專為需要在特定任務(如工具呼叫、錯誤偵測或資料擷取)中,使用一致框架在不同模型之間評估 LLM 性能的開發者與 AI 研究人員設計。

主要特色

  • 本地為先的桌面應用:專為管理與執行 LLM 基準測試而設計的專用環境。
  • Bench Pack 系統:支援可安裝、模組化的基準測試集,內建評分與驗證邏輯。
  • 代理控制:與 MCP 和 OpenAPI 整合,使外部 AI 代理可管理執行與模型。
  • 並排比較:可同時對多個模型在相同任務上的輸出進行比較。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案