pathwaycom/arc-task-gen

Generates original ARC-AGI-1-style tasks distribution-matched to the public eval set.

解决的问题

本项目解决了 AI 基准测试中的数据污染问题。由于公开的 ARC-AGI-1 数据集广泛可用,很难判断模型是真的在进行推理,还是仅仅在回忆训练期间见过的任务。该工具生成与公开数据集相似但模型从未见过的、分布一致的新任务,从而能够对 few-shot 规则归纳能力进行更真实的评估。

工作原理

该工具以标准 ARC 格式(包含训练和测试对的 tasks.json 文件)创建一个私有的评估任务集。这些生成的任务保持与原始 ARC-AGI-1 数据集相同的属性,使其在与现有评估工具兼容的同时,确保模型是在新问题上进行测试。

适用对象

正在构建推理模型(如 BDH-CQ 架构)的研究人员和开发人员,他们需要验证模型在 ARC-AGI-1 基准测试中的表现是源于真正的推理而非记忆。

亮点

  • 分布一致:生成反映公开 ARC-AGI-1 数据集特征的任务。
  • 基准测试兼容性:以标准 ARC JSON 格式生成输出,便于与现有工具集成。
  • 无污染:提供创建私有评估集的方法,以隔离 few-shot 规则归纳能力。
  • 独立验证:用于评估 BDH-CQ 模型,该模型已由包括 Transformer 架构共同作者在内的专家进行了独立复现。

相关

  • 项目
  • 项目
  • 项目
  • 项目