groq/openbench
Provider-agnostic, open-source evaluation infrastructure for language models
解决的问题
openbench 是一个提供商无关的开源基础设施,用于对大语言模型(LLMs)进行基准测试。它解决了评估流程分散且不一致的问题,提供了一种标准化、可复现的方法,可在不绑定单一模型提供商的情况下,对多种任务进行模型测试。
如何工作
基于 Inspect AI 框架构建,openbench 提供了一个精选的 95+ 个基准测试库(包括 MMLU、GPQA 和 HumanEval),以及一个简单的 CLI 工具(bench)来执行这些测试。它支持超过 30 个模型提供商,包括 Groq、OpenAI、Anthropic 以及本地选项如 Ollama,允许用户通过 API 密钥或本地设置,将同一套评估方案应用于不同模型。它还支持私有评估,允许用户直接指向本地评估文件。
适用人群
需要在多个领域(如数学、编程、推理)评估 LLM 性能,并使用一致方法比较不同提供商模型的 AI 开发者和研究人员。
主要亮点
- 广泛的提供商支持:开箱即用支持 30+ 个模型提供商。
- 丰富的基准库:包含 95+ 个基准,覆盖知识、科学和长上下文记忆等领域。
- 简洁的 CLI:提供简化命令,用于列出、运行和查看评估结果。
- 可扩展架构:通过 Python 入口点支持插件系统,可将自定义基准作为包分发。
- Hugging Face 集成:可直接将评估结果推送到 Hugging Face 数据集。
相关
- 项目
- 项目
- 项目
- 项目
- 项目