OpenAI GPT-6 Astra 在 ARC-AGI-3 基准测试中的表现

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准测试中取得了最先进的结果,展示了智能体智能(agentic intelligence)的重大飞跃。通过使用专门的 Provider Adapter harness,该模型在 Semi-Private 测试集上达到了 99.9% 的得分,同时在它完成的 96% 的关卡中,其动作效率超过了人类中位数基准。

ARC-AGI-3:衡量智能体智能

ARC-AGI-3 是一个旨在衡量当前 AI 与通用人工智能(AGI)之间“剩余差距”的基准测试。与之前的迭代版本不同,ARC-AGI-3 专注于在全新的、抽象的、基于回合的环境中智能体的能力,在这些环境中,智能体必须在没有明确指令的情况下进行探索并解决谜题。

该基准测试评估了智能的四个主要组成部分:

  • 探索(Exploration): 主动与环境交互以收集信息。
  • 建模(Modeling): 将原始观察结果转换为可泛化的模型以预测未来状态。
  • 目标设定(Goal-setting): 仅使用稀疏奖励来识别目标状态。
  • 规划与执行(Planning and Execution): 规划通往目标的路径并根据新数据进行纠偏。

GPT-6 Astra 的表现与成本

GPT-6 Astra 在不同的推理努力程度和 harness 配置下都表现出了极高的性能。结果显示,较高的推理努力通常会导致较低的总成本,因为模型通过更少的动作解决游戏,从而减少了所需的模型调用次数。

按 Harness 分类表现

  • Standard Harness: 这种中立于提供商的接口要求模型管理其自身的可见笔记。在这种配置下,Astra (max) 在 Semi-Private 集上的得分是 62.7%,成本为 $26,098。
  • Provider Adapter Harness: 这种 harness 保留了请求之间的不透明推理状态,并对长对话使用压缩技术。在这种配置下,Astra (high) 达到了 99.9% 的得分,成本为 $18,817。

推理努力程度对比

| Reasoning effort | Standard harness | Provider Adapter harness | | :--- | :--- | :--- | | | max | 62.7%, $26,098 | 98.6%, $17,332 | | xhigh | 59.3%, $37,317 | 98.4%, $18,147 | | high | 54.8%, $40,705 | 99.9%, $18,817 | | medium | 38.6%, $48,090 | 98.4%, $19,285 | | low | 17.5%, $38,166 | 98.0%, $21,298 | | none | 35.2%, $49,791 | 96.7%, $23,457 |

关键行为洞察

对 Astra 的回放进行分析后,揭示了有助于其高性能的三个不同能力:

1. 自定义符号世界模型

Astra 开发了一种即时的代数简写来跟踪游戏状态并规划动作。它并不使用完整的编程语言,而是创建紧凑、信息密集的笔记来记录坐标、规则和序列。例如,它可能会将状态记录为 L8: hub q2 (8↓). Lengths: 14=1… 或将计划记录为 extend8 to3; retract10 to2; shorten8 to1

2. 人类水平的动作效率

Astra (max) 使用 Provider Adapter harness 时,在 96.0% 的关卡中使用的动作比人类中位数更少,且平均每个关卡所需的动作比人类少 51.7%。这表明,一旦模型理解了环境的机制,它就会以匹配或超过人类表现的效率来执行解决方案。

3. 自主工具创建

当在 PRO-LONG harness 中进行评估时(该 harness 提供了一个代码执行沙盒),Astra 创建了针对特定游戏的自定义软件库。在迷宫类游戏 (tu93) 中,Astra 开发了单独的 Python 脚本用于导航 (maze_solver.py)、战斗规则 (combat_solver.py) 和巡逻建模 (patrol_solver.py),并使用同步脚本 (sync_state.py) 来验证预测与观察结果的一致性。

讨论与局限性

虽然这些结果是一个重大里程碑,但 ARC Prize 团队强调,填满这个基准测试并不构成 AGI 的证明。这些环境是确定性的且封闭式的,这并不反映真实世界的开放式复杂性。

Hacker News 上的社区讨论突出了几个关键视角:

"Is solving a snake like puzzle game in the least number of moves really what defines intelligence?"

"Was OpenAI able to run ARC-AGI-3 tests previously so that they could build a custom harness for the specific tests in the set?"

其他观察者指出,这些运行的成本极高(每个谜题约 $360),与人类劳动力相比,这很不寻常,尽管一些人认为,如果价格-性能趋势持续下去,AI 成本最终将下调至低于人类最低工资。

此外,外部数据表明,虽然 Astra 在 ARC-AGI-3 上表现出色,,但它在处理高度复杂的数学问题时仍然面临困难。根据关于 FrontierMath-Erdos 基准测试的报告,GPT-6 Astra 仅解决了 68 个问题中的 5 个,其中一些解决方案的需要超过 $220,000 的计算成本。

Sources

相关