OpenAI 和 Broadcom 发布 Jalapeño LLM 推理芯片
OpenAI 和 Broadcom 发布 Jalapeño LLM 推理芯片
OpenAI 和 Broadcom 发布了 Jalapeño,这是首款专为 LLM 推理设计的“智能处理器”。此定制加速器旨在通过优化硬件层以匹配前沿大型语言模型(LLMs)的特定需求,使高级 AI 更快速、更可靠且更实惠。
高效架构用于 LLM 推理
Jalapeño 是一种从零开始的设计,专注于 LLM 推理,而不是从以前的 AI 工作负载改编的通用加速器。该架构围绕着对前沿 AI 模型至关重要的内核、内存移动、网络和服务模式进行了优化。
关键技术目标和成果包括:
- 每瓦性能: 初步测试表明,第一代加速器的每瓦性能显著优于当前最先进的硬件。
- 硬件利用率: 该设计减少数据移动,平衡计算、内存和网络资源,以实现接近硬件理论峰值性能的实际利用率。
- 全栈集成: 该芯片旨在与所有 LLMs 兼容,参考了 OpenAI 内部的模型、内核、服务系统和产品需求路线图。
工程样品目前在实验室中以生产目标频率和功率运行 ML 工作负载,包括 GPT-5.3-Codex-Spark 模型。
加速的开发周期
Jalapeño 从初始设计到制造带出仅用了九个月。OpenAI 将此描述为在高性能先进半导体领域可能实现的最快 ASIC 开发周期。这一快速时间表得益于:
- 软硬件协同开发: OpenAI 工程团队与 Broadcom 的硅实现专长紧密合作。
- AI 驱动的设计: OpenAI 自有的模型被用于加速设计和优化过程的部分内容。 -n- 工业化合作伙伴: Broadcom 提供了硅实现和网络技术(包括 Tomahawk 网络硅),而 Celestica 提供了板卡、机架和系统集成方面的专长。
战略影响与部署
Jalapeño 是多代计算平台的第一次迭代。战略是构建全栈基础设施——涵盖芯片架构、内核、内存系统、网络和调度——以增加计算资源的丰富性。
部署时间表
- 初始部署: 计划于 2026 年底进行。
- 规模: 该平台旨在与微软及其他合作伙伴合作,在“吉瓦特级”数据中心进行部署。
对最终用户体验的影响
通过提高计算效率和降低成本,OpenAI 意图让这些硬件改进直接转化为面向用户的好处:ChatGPT 中的响应时间更快,Codex 中的任务执行更复杂,以及为开发者和企业提供更实惠的 API 产品。