pathwaycom/arc-task-gen
Generates original ARC-AGI-1-style tasks distribution-matched to the public eval set.
解决的问题
本项目解决了 AI 基准测试中的数据污染问题。由于公开的 ARC-AGI-1 数据集广泛可用,很难判断模型是真的在进行推理,还是仅仅在回忆训练期间见过的任务。该工具生成与公开数据集相似但模型从未见过的、分布一致的新任务,从而能够对 few-shot 规则归纳能力进行更真实的评估。
工作原理
该工具以标准 ARC 格式(包含训练和测试对的 tasks.json 文件)创建一个私有的评估任务集。这些生成的任务保持与原始 ARC-AGI-1 数据集相同的属性,使其在与现有评估工具兼容的同时,确保模型是在新问题上进行测试。
适用对象
正在构建推理模型(如 BDH-CQ 架构)的研究人员和开发人员,他们需要验证模型在 ARC-AGI-1 基准测试中的表现是源于真正的推理而非记忆。
亮点
- 分布一致:生成反映公开 ARC-AGI-1 数据集特征的任务。
- 基准测试兼容性:以标准 ARC JSON 格式生成输出,便于与现有工具集成。
- 无污染:提供创建私有评估集的方法,以隔离 few-shot 规则归纳能力。
- 独立验证:用于评估 BDH-CQ 模型,该模型已由包括 Transformer 架构共同作者在内的专家进行了独立复现。
相关
- 项目
- 项目
- 项目
- 项目