OpenAI 和 Broadcom 发布 Jalapeño LLM 推理芯片

OpenAI 和 Broadcom 发布 Jalapeño LLM 推理芯片

OpenAI 和 Broadcom 发布了 Jalapeño,这是首款专为 LLM 推理设计的“智能处理器”。此定制加速器旨在通过优化硬件层以匹配前沿大型语言模型(LLMs)的特定需求,使高级 AI 更快速、更可靠且更实惠。

高效架构用于 LLM 推理

Jalapeño 是一种从零开始的设计,专注于 LLM 推理,而不是从以前的 AI 工作负载改编的通用加速器。该架构围绕着对前沿 AI 模型至关重要的内核、内存移动、网络和服务模式进行了优化。

关键技术目标和成果包括:

  • 每瓦性能: 初步测试表明,第一代加速器的每瓦性能显著优于当前最先进的硬件。
  • 硬件利用率: 该设计减少数据移动,平衡计算、内存和网络资源,以实现接近硬件理论峰值性能的实际利用率。
  • 全栈集成: 该芯片旨在与所有 LLMs 兼容,参考了 OpenAI 内部的模型、内核、服务系统和产品需求路线图。

工程样品目前在实验室中以生产目标频率和功率运行 ML 工作负载,包括 GPT-5.3-Codex-Spark 模型。

加速的开发周期

Jalapeño 从初始设计到制造带出仅用了九个月。OpenAI 将此描述为在高性能先进半导体领域可能实现的最快 ASIC 开发周期。这一快速时间表得益于:

  • 软硬件协同开发: OpenAI 工程团队与 Broadcom 的硅实现专长紧密合作。
  • AI 驱动的设计: OpenAI 自有的模型被用于加速设计和优化过程的部分内容。 -n- 工业化合作伙伴: Broadcom 提供了硅实现和网络技术(包括 Tomahawk 网络硅),而 Celestica 提供了板卡、机架和系统集成方面的专长。

战略影响与部署

Jalapeño 是多代计算平台的第一次迭代。战略是构建全栈基础设施——涵盖芯片架构、内核、内存系统、网络和调度——以增加计算资源的丰富性。

部署时间表

  • 初始部署: 计划于 2026 年底进行。
  • 规模: 该平台旨在与微软及其他合作伙伴合作,在“吉瓦特级”数据中心进行部署。

对最终用户体验的影响

通过提高计算效率和降低成本,OpenAI 意图让这些硬件改进直接转化为面向用户的好处:ChatGPT 中的响应时间更快,Codex 中的任务执行更复杂,以及为开发者和企业提供更实惠的 API 产品。

Sources