OpenAI Jalapeño 推論晶片:架構與效能分析
OpenAI 宣布推出 "Jalapeño",這是一款從零開始設計,專為大型語言模型 (LLM) 推論而生的客製化推論晶片。該晶片是與 Broadcom 合作開發的,代表了極其激進的開發週期,從 2024 年年中開始,從最初的團隊招募到製造投片 (tape-out) 大約僅耗時 16 個月。
效能基準測試與效率
Jalapeño 在每瓦效能 (perf/W) 方面展現了業界領先的表現,在多種情境下超越了 Nvidia Blackwell 以及更先進的 Vera Rubin 架構。根據使用 InferenceX 套件進行的基準測試,Jalapeño 在低延遲與高吞吐量的場景中表現優異,且無需 Multi Token Prediction (MTP) 或投機解碼 (speculative decoding)。
關鍵效能指標
- 互動性: 在 DeepSeek R1 模型上,Jalapeño 在併發度為 1 時,每位使用者可達到超過 700 tokens per second。
- 吞吐量: 對於 GPT-OSS 等模型,該晶片每位使用者可達到約 1,400 tokens per second。
- 能源效率: Jalapeño 每兆瓦 (MW) 的輸出 token 吞吐量超過了 Vera Rubin 的 MTP 結果,並顯著優於 GB200 的 2025 年預期結果。
- TCO: 在每單位 TCO 的效能表現上,Jalapeño 目前與 Vera Rubin 持平,不過 Jalapeño 的結果是在沒有使用投機解碼的情況下獲得的,一旦實施該技術,成本可能額外降低 3-5 倍。
硬體架構
Jalapeño 是一款通用型推論晶片,而非僅針對單一模型進行優化。其設計旨在最大化 HBM 頻寬,並將權重 (weights) 與 KV caches 的記憶體移動量降至最低。
技術規格
- 製造: B0 stepping 採用 TSMC 的 N3P 製程。
- TDP: 該晶片的熱設計功耗 (TDP) 為 700W,低於 Rubin 的 900-1,150W。
- 記憶體: 它利用 HBM4,每個封裝提供 15.4 TB/s 的記憶體頻寬,超越了使用 HBM3E 的加速器。 -計算: B0 stepping 在單個 reticle-sized compute die 上可提供 13.4 PFLOPs 的 MXFP4。
- I/O: 一個 N3E I/O chiplet 提供 32 條 800G SerDes 通道,其中 24 條用於本地規模擴展 (local scale-up),8 條用於全域規模擴展 (local scale-up)。
架構創新
- 統一記憶體池: 與某些競爭對手不同,OpenAI 並未選擇在不同的晶片池中將 prefill 與 decode (PD) 分離。這種同質化池化設計允許系統隨著工作負載混合比例 (input/output ratios) 隨時間變化的情況下保持靈活性。
- Out-of-Order (OoO) 核心: Jalapeño 使用帶有 L1 caches 的 OoO 核心,而非軟體管理的 scratchpads。這減少了如 barrier latencies 等固定開銷,使晶片能更接近其理論硬體 roofline。
- 矩陣引擎: 矩陣引擎使用 MXFP 數值格式與 weight-stationary systolic array,支援更小的形狀與維度,以避免在較大的 systolic array 中常見的效能瓶頸 (performance cliffs)。
軟體堆疊與核心開發
OpenAI 繞過了傳統的通用編譯器,轉而採用高性能、低階層的程式設計方法。
Gluon 與 Linear Layouts
OpenAI 使用一種稱為 Gluon 的核心程式語言,該語言建立在 Triton 之上。Gluon 揭示了低階層抽象,並引入了 "Linear Layouts",這是一種將硬體資源與 tensor elements 之間映射關係的數學形式化定義。這使得佈局轉換 (layout conversions) 能夠在證明其正確性的同時,達到最佳的記憶體 swizzling。
AI 輔助核心生成
OpenAI 利用內部版本的 Codex 撰寫手動調優的核心 (some reaching 3,000 lines),並以組合語言 (assembly) 的形式呈現。這種 AI 驅動的方法讓團隊能夠快速且無需人工干預地開發出複雜的核心,例如用於 DeepSeek 的 MLA kernels。
系統級整合
Jalapeño 的部署方式為一個由主機機架 (
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch