OpenAI Jalapeño 推理芯片首批结果
OpenAI 发布了其首款定制推理芯片 Jalapeño 的首批性能结果。该硬件旨在消除吞吐量与延迟之间的传统权衡,为大规模 AI 模型和交互式智能体提供更快的响应速度和更高的能效比。
性能基准测试与效率
Jalapeño 在包括 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 在内的多种模型架构中展现了行业领先的效率和速度。使用 SemiAnalysis 的 InferenceX 公开基准测试,OpenAI 报告称 Jalapeño 在每瓦性能和延迟方面始终处于帕累托前沿(Pareto frontier)。
关键性能提升包括:
- 能效比: 与对比系统相比,Jalapeño 在峰值吞吐量下的每瓦 AI 工作量提升了 1.5 到 1.9 倍。
- 延迟降低: 端到端延迟比现有系统低 1.7 到 3.6 倍。
- 交互式工作负载: 对于高度交互的使用场景,该芯片提供的性能提升了 2.1 到 4.1 倍。
具体模型结果显示,在测试的最大公开模型 Kimi K2.5 1T 上,Jalapeño 实现了约 1.5 倍更高的每瓦峰值性能,以及低 3.4 倍的端到端延迟。该芯片的额定功率为 700 瓦,但在测试期间测得的持续功率保持在 550 瓦或以下。
全栈架构设计
Jalapeño 被构建为一个全栈解决方案,其中芯片、内存、网络和软件经过协同设计,以最大限度地减少数据移动和通信延迟。这种方法解决了语言模型推理的特定瓶颈:
- Prefill Phase(预填充阶段): 针对计算密集型的提示词处理进行了优化。
- Decode Phase(解码阶段): 针对内存带宽受限的 Token 生成进行了优化。
通过将模型状态和 KV cache 本地化放置,系统减少了处理单元在等待数据时处于闲置状态的时间。集成网络允许整个工作负载保持在一个连接的系统中,从而创建一个能够适应智能体工作负载不断变化的需求的平衡加速器。
AI 驱动的硬件开发
OpenAI 利用其自身的 AI 模型来加速 Jalapeño 芯片的设计和编程,将从初始设计到流片(tapeout)的时间缩短至九个月。AI 被用于优化算术电路并缩短验证循环。
此外,该芯片被设计为一个可预测的 AI 编程目标。通过使用 Codex 配合 GPT-Astra,OpenAI 工程师在两个月内将三个开源权重模型带到了高性能水平。在针对 GPT-OSS attention 和 mixture-of-experts 模块的特定测试中,AI 生成的实现比人类专家编写的代码运行速度快 1.5 到 1.8 倍。
部署路线图
OpenAI 计划在年底前在其计算基础设施中开始部署 Jalapeño。该芯片代表了多代平台中的第一代,第二代(Gen 2)已在开发中,第三代(Gen 3)目前正在成型中。
在部署自有硅片的同时,OpenAI 表示,它将继续使用 NVIDIA 和其他合作伙伴的加速器来进行训练和推理工作负载,以满足日益增长的需求。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch