OpenAI GPT-5.6 Sol ARC-AGI-3 基准性能优化
OpenAI 通过启用两个特定的 API 设置——保留推理和压缩,证明了 GPT-5.6 Sol 在 ARC-AGI-3 基准上的性能从 13.3% 提升至 38.3%。这一发现凸显了基准得分往往反映评估 harness 的配置,而不仅仅是模型固有的能力。
ARC-AGI-3 性能提升
GPT-5.6 Sol 在使用带有已启用保留推理和压缩的 Responses API 驱动的 harness 时,在 ARC-AGI-3 公开集上获得了 38.3% 的得分。相比之下,官方 ARC-AGI-3 harness 得分为 13.3%。
这些得分使用 Relative Human Action Efficiency (RHAE) 进行测量,该指标将模型性能与人类基线进行比较。作为参考,OpenAI 估计平均人类测试者在相同任务上的得分为 48%。该提升表示性能几乎提高了三倍,同时输出 token 减少了 6倍。
harness 设计对模型推理的影响
官方 ARC-AGI-3 harness 采用通用设计,以使模型不足更明显并确保公平比较。然而,OpenAI 在此 harness 中发现了两个主要限制,这些限制阻碍了 GPT-5.6 Sol 在 2D 拼图游戏中的学习和推理能力:
被丢弃的推理
在官方 harness 中,所有私有推理在每次游戏动作后被丢弃。这迫使模型在每回合从头重新解释游戏状态,因为它无法访问导致之前动作的计划、洞察或思想。
滚动截断
为了管理上下文限制,官方 harness 采用滚动截断,一旦对话超过 175,000 个字符,就会丢弃最旧的消息。这导致模型丢失对其最早观察和行动的记忆,并且通过保持上下文窗口始终满载,可能会损害性能。
技术解决方案:保留推理和压缩
为了使评估与模型在 ChatGPT 和 Codex 中的部署方式保持一致,OpenAI 使用 Responses API 实现了一个 harness。此方法引入了两项关键的技术改进:
保留推理
通过在 Responses API 中传递之前的响应 ID,GPT-5.6 Sol 会自动在工具调用和回合之间保留其私有推理。这使得模型能够随着时间的推移采用连贯的策略,并减少每次行动前的思考时间,因为它不再需要从每回合的开始重新分析游戏。
压缩
用压缩替换滚动截断使模型能够在更长的运行中更好地保留所学信息。与仅删除旧数据的滚动截断不同,压缩能够更高效地管理上下文,使模型在使用更少输出 token 的情况下保持更高的得分。
给 API 开发者的建议
OpenAI 建议,寻求最大化模型性能的开发者应采用其生产环境中使用的设置。具体来说,他们建议:
- 使用 Responses API 而不是遗留的 Chat Completions API。
- 保留推理 以允许模型在交互中保持逻辑线程。
- 使用压缩 以管理上下文窗口而不丢失关键的早期回合信息。