groq/openbench

Provider-agnostic, open-source evaluation infrastructure for language models

解決的問題

openbench 是一個提供者無關的開源基礎設施,用於對大型語言模型(LLMs)進行基準測試。它解決了評估流程分散且不一致的問題,提供了一種標準化、可重現的方式,讓使用者能在不綁定單一模型提供者的情況下,對各種任務進行模型測試。

如何運作

基於 Inspect AI 框架建構,openbench 提供了一個精心挑選的 95+ 個基準測試庫(包含 MMLU、GPQA 和 HumanEval),以及一個簡單的 CLI 工具(bench)來執行這些測試。它支援超過 30 個模型提供者,包括 Groq、OpenAI、Anthropic 以及本地選項如 Ollama,允許使用者透過 API 金鑰或本地設定,將同一套評估方案應用於不同模型。它也支援私有評估,讓使用者可直接指向本地評估檔案。

適用對象

需要在多個領域(如數學、程式設計、推理)評估 LLM 性能,並使用一致方法比較不同提供者模型的 AI 開發者與研究人員。

主要亮點

  • 廣泛的提供者支援:開箱即用支援 30+ 個模型提供者。
  • 豐富的基準庫:包含 95+ 個基準,涵蓋知識、科學與長上下文記憶等領域。
  • 簡潔的 CLI:提供簡化命令,用於列出、執行與檢視評估結果。
  • 可擴展架構:透過 Python 入口點支援插件系統,可將自訂基準作為套件分發。
  • Hugging Face 整合:可直接將評估結果推送到 Hugging Face 資料集。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案