arcprize/arc-agi-benchmarking

Testing baseline LLMs performance across various models

它解决了什么问题

这个项目为在 ARC-AGI(抽象与推理语料库)任务上对 AI 模型进行基准测试提供了一个标准化框架。它简化了在各种模型提供商之间运行这些复杂推理任务的过程,处理了 API 速率限制、重试和性能评分等操作开销。

它如何工作

该系统使用一组模型适配器来与不同的 AI 服务提供商(如 OpenAI、Anthropic、Gemini 和 Grok)进行交互。用户在 YAML 文件中定义模型配置,指定温度、令牌限制等参数。基准测试工具随后执行 ARC-AGI 数据集中的任务,跨多个配置管理并发请求,并记录原始 API 交互。最后,一个专用的评分脚本将模型生成的输出与真实答案进行比较,以计算准确率。

适用对象

专为希望使用 ARC-AGI 基准测试评估大语言模型通用智能和推理能力的 AI 研究人员和开发者设计。

主要特性

  • 多提供商支持:内置对多种提供商的适配器,包括 OpenAI、Anthropic、Gemini、Fireworks 和 Grok。
  • 稳健执行:包含内置的速率限制、基于 tenacity 的重试机制,以及使用 asyncio 实现高效的批量处理。
  • 可扩展的基准测试:能够在不同数据集上并行运行多个模型配置,同时共享提供商的速率限制。
  • 详细日志记录:为每个任务自动生成原始 API JSONL 日志,用于追踪模型推理过程和请求历史。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目