arcprize/arc-agi-benchmarking
Testing baseline LLMs performance across various models
它解决了什么问题
这个项目为在 ARC-AGI(抽象与推理语料库)任务上对 AI 模型进行基准测试提供了一个标准化框架。它简化了在各种模型提供商之间运行这些复杂推理任务的过程,处理了 API 速率限制、重试和性能评分等操作开销。
它如何工作
该系统使用一组模型适配器来与不同的 AI 服务提供商(如 OpenAI、Anthropic、Gemini 和 Grok)进行交互。用户在 YAML 文件中定义模型配置,指定温度、令牌限制等参数。基准测试工具随后执行 ARC-AGI 数据集中的任务,跨多个配置管理并发请求,并记录原始 API 交互。最后,一个专用的评分脚本将模型生成的输出与真实答案进行比较,以计算准确率。
适用对象
专为希望使用 ARC-AGI 基准测试评估大语言模型通用智能和推理能力的 AI 研究人员和开发者设计。
主要特性
- 多提供商支持:内置对多种提供商的适配器,包括 OpenAI、Anthropic、Gemini、Fireworks 和 Grok。
- 稳健执行:包含内置的速率限制、基于 tenacity 的重试机制,以及使用 asyncio 实现高效的批量处理。
- 可扩展的基准测试:能够在不同数据集上并行运行多个模型配置,同时共享提供商的速率限制。
- 详细日志记录:为每个任务自动生成原始 API JSONL 日志,用于追踪模型推理过程和请求历史。
相关
- 项目
- 项目
- 项目
- 项目
- 项目