GPT-5.3-Codex-Spark 发布说明

OpenAI 已发布 GPT-5.3-Codex-Spark 的研究预览版,这是 GPT-5.3-Codex 的小规模版本,专为实时交互式编码设计。通过与 Cerebras 的合作,该模型每秒可输出超过 1,000 个 token,使开发者能够进行有针对性的编辑并以几乎即时的反馈重塑逻辑。

实时编码能力

GPT-5.3-Codex-Spark 针对延迟与智能同等关键的交互式工作流进行优化。不同于为自主、长时间任务设计的更大模型,Codex-Spark 调整为轻量化工作方式,专注于最小化、针对性的编辑,并在未明确请求时避免自动执行测试。这使开发者能够实时中断或重定向模型,快速迭代界面和逻辑。

性能与基准测试

尽管体积更小,Codex-Spark 在实际软件工程任务中仍保持高能力。在评估代理式软件工程的 SWE-Bench Pro 和 Terminal-Bench 2.0 基准测试中,该模型表现出强劲的性能,并在完成任务所需时间上仅为完整 GPT-5.3-Codex 模型的很小一部分。

基础设施与延迟优化

为支持实时协作,OpenAI 在整个请求-响应管道中实现了端到端的延迟改进。这些优化惠及所有模型,具体包括:

  • Pipeline Streamlining: 重写推理栈并优化会话初始化,将首 token 响应时间缩短 50%。
  • Network Efficiency: 引入持久化 WebSocket 连接并对 Responses API 进行优化,使每个客户端/服务器往返开销降低 80%,每个 token 的开销降低 30%。

与 Cerebras 的硬件集成

GPT-5.3-Codex-Spark 由 Cerebras Wafer Scale Engine 3 提供动力,这是一款专为高速推理设计的 AI 加速器。虽然 GPU 仍是成本效益广泛使用的主要基础,但 Cerebras 硬件提供了以低延迟为先的服务层,补充 GPU,以缩紧开发者的迭代循环。

"我们对 GPT-5.3-Codex-Spark 最感兴趣的,是与 OpenAI 以及开发者社区的合作,去探索快速推理所能实现的可能——全新的交互模式、新的使用场景,以及根本不同的模型体验。"

— Sean Lie, CTO and Co-Founder of Cerebras

可用性与技术规格

Codex-Spark 目前作为研究预览版向 ChatGPT Pro 用户提供,可通过 Codex 应用、CLI 和 VS Code 扩展使用。它也在 API 中向少数设计合作伙伴开放。

Technical Specifications:

  • Context Window: 128k tokens.
  • Modality: 文本。
  • Safety: 该模型已通过标准部署评估,但未达到 Preparedness Framework 对网络安全或生物学高能力的阈值。

未来路线图

OpenAI 计划将 Codex-Spark 打造成超高速模型系列的首款。长期目标是打造一种混合式 Codex 体验,将长时程推理与执行与实时协作相结合。这将使用户在保持交互循环的同时,将复杂的后台工作委派给子代理,或将任务并行分配给多个模型。

Sources