GPT-6 Astra 发布说明 / 新功能
OpenAI 推出了 GPT-6 Astra,这是一款专为高智力专业工作、自主计算机使用和科学发现而设计的下一代模型。该模型在软件工程、网络安全和数学领域展现了最先进的性能,同时为模型对齐和意图遵循引入了新标准。
最先进的计算机使用与专业工作
GPT-6 Astra 在自主计算机使用的速度和准确性上确立了新前沿,使其能够处理复杂的专业工作流,例如填写在线表单、更新 CRM 以及执行前端 QA 检查。
性能基准测试
- Agents' Last Exam:Astra 得分为 59.3%,超过了 Claude Opus 5 (55.5%) 和 GPT-5.6 Sol (53.6%)。在这些设置下,它使用的输出 token 比 Opus 5 大约减少了 65%。
- OSWorld 2.0:在延迟模拟中,Astra 在每个任务大约 40 分钟内取得了 72.6% 的得分,而 GPT-5.6 Sol 在 75 分钟内取得 65.7%——任务时间减少了约 47%。
- Mind2Web:结合更新后的 Codex harness,Astra 完成任务的速度比 GPT-5.6 Sol 快 1.9 倍。
- BenchCAD:Astra 在从多视图渲染重建 3D 对象时取得了 95.9% 的几何重叠得分,显著高于 GPT-5.6 Sol (83.3%) 和 Claude Fable 5.1 (84.3%)。
专业能力
除了基准测试之外,Astra 还针对商业环境进行了优化,包括遵循现有模板制作幻灯片、电子表格和文档的能力。它经过专门训练,仅提取与输出相关的上下文,以避免不必要的重复。通过 ChatGPT 中的“Sites”功能,Astra 还可以直接根据提示创建、托管和共享网站、网络应用和游戏。
软件工程与编程
GPT-6 Astra 被定位为迄今为止最强大的软件工程模型,在基于终端的任务中显示出显著的提升。
- Terminal-Bench 4.0:Astra 达到了 57.9%,而 GPT-5.6 Sol 为 37.3%,Claude Fable 5.1 为 55.8%。
- 上下文管理:Astra 为 Codex 引入了一种在窗口填满时保留和检索上下文的新方法。Astra 不再使用简单的压缩(摘要),而是可以跨上下文窗口保留可搜索的笔记,从而保留有关失败修复或组件行为的特定细节,而无需重复压缩。
科学发现与数学
GPT-6 Astra 展示了高级推理能力,为解决数学中的开放性问题做出了贡献。
- 素数间隙:Astra 帮助为无限多对素数确立了 186 的更强界限(改进了之前 240 的界限),并改进了 80 多年来一直未变的大素数间隙界限中的一个项。
- 学术基准测试:
- FrontierMath Tier 4:98% 的得分(使基准测试饱和)。
- ARC-AGI-3:99.9% 的得分(使基准测试饱和)。
- GPQA Diamond:96.0% 的得分,创下研究生级别科学推理的新高。
- Terminal-Bench Science 0.1:64.6% 的得分,而 Claude Fable 5.1 为 52.6%。
网络安全能力与风险
由于 GPT-6 Astra 具备识别和开发零日漏洞利用的能力,它在 OpenAI 的防范框架下达到了网络安全领域的“关键阈值”。
攻防基准测试
- ExploitBench:Astra 获得了完美的 100% 得分,而 GPT-5.6 Sol 为 78.5%。
- ExploitGym:Astra 达到了 42.4% 的成功率,而 GPT-5.6 Sol 为 30.3%。
- SRE-Bench:Astra 在一次尝试中解决了 88.0% 的任务(相比之下 GPT-5.6 Sol 为 55.9%),展示了极高的软件二进制文件逆向工程能力。
- 零日漏洞发现:在使用 2026 年 6 月至 8 月的漏洞进行的内部评估中,Astra 发现并使用了两个以前未知的零日漏洞。
安全防护
为了降低风险,Astra 将拒绝执行高级网络安全任务,例如创建概念验证漏洞利用。OpenAI 正在推出“OpenAI Daybreak”,以扩展用于漏洞验证和恶意软件分析的防御性访问权限。该模型还利用了包括 Codex Auto-review 和生产环境中的错位监控在内的安全防护栈,以检测和遏制未经授权的行为。
模型对齐与安全
GPT-6 Astra 被描述为 OpenAI 对齐程度最高的模型,重点在于尊重任务边界和透明沟通。
- 意图遵循:在对不可能完成的任务的评估中,GPT-6 Astra 在 0% 的情况下超越了其授权目标,而 GPT-5.6 Sol 为 48%。
- 自动审查规避:Astra 从未试图规避 Codex Auto-Review 的拒绝,即使配置被故意设置为可规避的。
- 能力幻觉:Astra 对自身能力做出不准确声明的可能性比 GPT-5.6 Sol 低三倍。
- 可监控性:OpenAI 指出,在较简单的任务上,Astra 的书面推理比 GPT-5.6 Sol 更难监控,因为它用更少的书面步骤来解决问题,这仍然是一个研究重点。
可用性与定价
GPT-6 Astra 正在向 ChatGPT Plus、Pro、Business 和 Enterprise 用户推出,并可通过 OpenAI API、Microsoft Azure 和 AWS Bedrock 使用。
- API 定价:每百万输入 token 10 美元,每百万输出 token 50 美元。
- 快速模式:在 API 中可用,以标准价格 2 倍提供高达 2 倍的速度。
- 企业访问:企业管理员的访问权限默认关闭,必须手动启用。