GPT-6 Astra 发布说明 / 更新内容
GPT-6 Astra 支持专业工作流中的直接计算机使用能力
GPT-6 Astra 旨在在现有的业务应用程序和工作流中运行,无需自定义 API 或数据准备。通过利用计算机使用能力,Astra 可以像人类一样与软件进行交互,从而使其从第一天起就能在各种应用程序中执行任务。
关键的专业应用包括:
- Financial Modeling(财务建模):在来自 Financial Modeling World Cup(基于 2023 Microsoft Excel World Championship)的挑战中,GPT-6 Astra 完成任务的速度比获胜的人类选手快约四倍。
- Software Engineering(软件工程):OpenAI 的内部工程团队使用 Astra 解决了测试环境中的内存分配瓶颈,实现了 25 倍的更低周转延迟,同时峰值内存使用量增加了约 30%。
- Content Creation(内容创作):该模型可以遵循公司特定的语气、模板和设计标准,例如创建符合企业特定布局和语调的幻灯片演示文稿。
性能与成本效益基准测试
GPT-6 Astra 旨在通过使用更少的 token 和更少的重试次数来完成任务,从而降低单次任务的成本。OpenAI 报告称,Astra 在专业工作和编码评估中占据了成本效益前沿的大部分领域。
Terminal Bench 4.0 测试结果
在 Terminal Bench 4.0(该基准测试评估智能体在复杂的基于终端的任务,包括系统配置和数据分析)上,GPT-6 Astra 获得了 57.9% 的分数。这优于之前的模型:
- GPT-5.6 Sol:37.3%(Astra 在估计的单次任务 API 成本上低约 9%)。
- Claude Fable 5.1:55.8%(Astra 在估计的单次任务 API 成本上低约 63%)。
定价
GPT-6 Astra 的 API 定价从每百万输入 token 10 美元和每百万输出 token 50 美元起。
安全、对齐与企业控制
GPT-6 Astra 是 OpenAI 迄今为止对齐程度最高的模型,具有更高的对人类意图和授权的遵循能力,以确保在业务系统中安全运行。
计算机使用安全基准测试
在测试数据删除或机密信息泄露等场景的内部计算机使用安全基准测试中,Astra 产生非预期结果的频率比 GPT-5.6 Sol 低 89%,比 Claude Fable 5.1 低 74.7%。
企业管理控制
为了管理部署,OpenAI 推出了新的企业管理员控制功能,允许组织:
- 限制对已批准网站和桌面应用程序的访问。
- 管理上传和下载。
- 控制浏览历史记录。
- 实施需要对重大影响操作进行批准的确认策略。
- 对潜在不安全或未经授权的工具调用进行自动审查。
网络安全与准备工作
GPT-6 Astra 是第一个在 OpenAI 的 Preparedness Framework 下达到“关键网络安全能力阈值”的模型。作为回应,OpenAI 加强了针对滥用和未经授权操作的保护,包括训练模型尊重安全边界并部署自动检查以拦截有害响应。
可用性与集成
GPT-6 Astra 可通过 ChatGPT Work、Codex 以及 API 使用。为了扩大访问范围,OpenAI 正在 ChatGPT Desktop 中为 Oracle Analytics、Power BI(Microsoft Fabric 服务)推出新的企业插件,涵盖 Oracle Analytics、Power BI (a Microsoft Fabric service)、Navan 和 Avalara。