pathwaycom/arc-task-gen

Generates original ARC-AGI-1-style tasks distribution-matched to the public eval set.

解決的問題

本專案解決了 AI 基準測試中的數據污染問題。由於公開的 ARC-AGI-1 數據集廣泛可用,很難判斷模型是真的在進行推理,還是僅僅在回憶訓練期間見過的任務。該工具生成與公開數據集相似但模型從未見過的、分佈一致的新任務,從而能夠對 few-shot 規則歸納能力進行更真實的評估。

工作原理

該工具以標準 ARC 格式(包含訓練與測試對的 tasks.json 檔案)建立一個私有的評估任務集。這些生成的任務保持與原始 ARC-AGI-1 數據集相同的屬性,使其在與現有評估工具相容的同時,確保模型是在新問題上進行測試。

適用對象

正在構建推理模型(如 BDH-CQ 架構)的研究人員與開發人員,他們需要驗證模型在 ARC-AGI-1 基準測試中的表現是源於真正的推理而非記憶。

亮點

  • 分佈一致:生成反映公開 ARC-AGI-1 數據集特徵的任務。
  • 基準測試相容性:以標準 ARC JSON 格式生成輸出,便於與現有工具整合。
  • 無污染:提供建立私有評估集的方法,以隔離 few-shot 規則歸納能力。
  • 獨立驗證:用於評估 BDH-CQ 模型,該模型已由包括 Transformer 架構共同作者在內的專家進行了獨立復現。

相關

  • 專案
  • 專案
  • 專案
  • 專案