pathwaycom/arc-task-gen
Generates original ARC-AGI-1-style tasks distribution-matched to the public eval set.
解決的問題
本專案解決了 AI 基準測試中的數據污染問題。由於公開的 ARC-AGI-1 數據集廣泛可用,很難判斷模型是真的在進行推理,還是僅僅在回憶訓練期間見過的任務。該工具生成與公開數據集相似但模型從未見過的、分佈一致的新任務,從而能夠對 few-shot 規則歸納能力進行更真實的評估。
工作原理
該工具以標準 ARC 格式(包含訓練與測試對的 tasks.json 檔案)建立一個私有的評估任務集。這些生成的任務保持與原始 ARC-AGI-1 數據集相同的屬性,使其在與現有評估工具相容的同時,確保模型是在新問題上進行測試。
適用對象
正在構建推理模型(如 BDH-CQ 架構)的研究人員與開發人員,他們需要驗證模型在 ARC-AGI-1 基準測試中的表現是源於真正的推理而非記憶。
亮點
- 分佈一致:生成反映公開 ARC-AGI-1 數據集特徵的任務。
- 基準測試相容性:以標準 ARC JSON 格式生成輸出,便於與現有工具整合。
- 無污染:提供建立私有評估集的方法,以隔離 few-shot 規則歸納能力。
- 獨立驗證:用於評估 BDH-CQ 模型,該模型已由包括 Transformer 架構共同作者在內的專家進行了獨立復現。
相關
- 專案
- 專案
- 專案
- 專案