arcprize/arc-agi-benchmarking
Testing baseline LLMs performance across various models
解決的問題
此專案提供了一個標準化的框架,用於在 ARC-AGI(抽象與推理語料庫)任務上對 AI 模型進行基準測試。它簡化了在不同模型提供者之間執行這些複雜推理任務的流程,並處理 API 速率限制、重試機制和性能評分等運營開銷。
工作原理
系統使用一組模型適配器來與不同的 AI 提供者(如 OpenAI、Anthropic、Gemini 和 Grok)進行介接。使用者在 YAML 檔案中定義模型設定,指定如溫度和 token 限制等參數。基準測試工具隨後執行 ARC-AGI 資料集中的任務,跨多個設定管理並行請求,並記錄原始的 API 互動。最後,專用的評分腳本會將模型生成的輸出與真實答案進行比較,以計算準確率。
適用對象
此工具專為希望使用 ARC-AGI 基準測試來評估大型語言模型(LLM)通用智慧與推理能力的 AI 研究人員和開發者設計。
主要特色
- 多提供者支援:內建廣泛提供者的適配器,包括 OpenAI、Anthropic、Gemini、Fireworks 和 Grok。
- 穩健執行:內建速率限制、基於 tenacity 的重試機制,以及 asyncio 以實現高效的批次處理。
- 可擴展的基準測試:可在不同資料集上並行執行多個模型設定,並共享提供者的速率限制。
- 詳細記錄:自動為每個任務生成原始 API JSONL 日誌,以追蹤模型推理過程與請求歷史。
相關
- 專案
- 專案
- 專案
- 專案
- 專案