OpenAI Jalapeño: 与 Broadcom 合作开发的定制推理芯片
OpenAI 发布 Jalapeño 推理处理器
OpenAI 推出了其首款定制推理处理器,命名为 Jalapeño,是与 Broadcom 合作开发的。该芯片专门设计用于优化 AI 工作负载的推理阶段——即运行预构建模型以生成响应的过程——而不是预训练阶段,后者可能会继续依赖 Nvidia GPU。
早期测试表明,Jalapeño 的每瓦性能表现显著优于目前的尖端替代方案。根据 Broadcom CEO Hock Tan 的说法,与典型的 AI GPU 相比,该加速器展示了约 50% 的成本节约。
向全栈基础设施的战略转移
OpenAI 正在转向垂直整合战略,以减少对 Nvidia 等第三方硬件提供商的依赖。通过设计自己的硅片,OpenAI 旨在优化其技术栈的每一层,使模型更快、更可靠且更经济实惠。
该公司的基础设施战略现在包括:
- Chip Architecture: 定制硅片,针对特定的、目前服务不足的工作负载进行定制。
- Software Layers: 内核、内存系统和调度开发。
- Deployment: 管理网络和部署系统,以改善整体产品体验。
OpenAI President Greg Brockman 表示,公司对其自身工作负载的深入理解使其能够识别出特定领域,在这些领域中,定制硬件可以加速目前通用硬件无法充分满足的能力。
开发与制造流程
Jalapeño 从设计到生产仅用了九个月。OpenAI 报告称,其自身的 AI 模型被用于辅助芯片的设计和优化过程。虽然 OpenAI 和 Broadcom 负责设计,但芯片由 TSMC 制造。
技术分析与行业观点
行业观察家和技术社区成员就此举的影响提出了几点看法:
“廉价 Token”经济学
降低推理成本对于 AI 的长期经济效益至关重要。随着开源权重模型变得越来越具有竞争力,AI 提供商的主要差异化因素将是公司为消费者和企业提供最低 Token 成本的能力。
硬件过时风险
一些批评者认为,AI 架构突破的快速步伐——例如量化和卸载——可能会在公司实现显著的投资回报率 (ROI) 之前,使定制硬件过时。人们担心,LLM 架构的飞跃可能会使当前的高端数据中心硬件一夜之间过时。
运营挑战
虽然设计芯片是一个重大里程碑,但大规模部署它面临着不同的挑战。与 Google (拥有 TPUs) 和 Amazon (拥有 Trainium) 等超大规模厂商不同,OpenAI 必须管理封装、冷却、供电以及在大型数据中心中管理定制硅片集群的复杂性。
与其他 AI 加速器的比较
OpenAI 的举动反映了 Google 和 Amazon 此前采取的策略。一些观察家指出,Google 的 TPU (Tensor Processing Unit) 谱系(目前已进入第七代)为在 AI 基础设施领域保持竞争优势的必要性提供了先例。