GLM-5.3-Flash 推理基礎設施:如何由 AI 代理建構 100k 加速器服務
TL;DR
GLM‑5.3‑Flash 的推理服務在不到兩週內,於超過 100,000 個中國人工智慧加速器的叢集中從零開始建立,主要由一個由 GLM‑5.3 驅動的 Infra Agent(基礎設施代理)推動完成。透過結合激進的記憶體優化、自訂的 Encode‑Prefill‑Decode 架構,以及將稀疏的端到端指標轉化為細緻且可操作的信號的「密集反饋」迴圈,團隊將吞吐量提升了三倍,並達到與主流 NVIDIA GPU 相當的硬體效率。
1. 為何 GLM‑5.3‑Flash 的基礎設施至關重要
- 此系統展現了朝向 遞迴自我改進(RSI) 的具體一步:一個模型協助設計、建構與優化未來訓練其繼承者的硬體與軟體。
- 在先前未經測試的硬體堆疊(中國製加速器)上實現生產級效能,證明大規模人工智慧推理可脫離主導的 NVIDIA 生態系統。
- 三倍的吞吐量提升與六天內處理 62 兆個 token 的成果,顯示 AI 驅動的基礎設施工程能大幅縮短開發週期。
2. 從零建構 100k 加速器叢集
- 硬體限制:片上記憶體有限、頻寬狹窄、核心支援不成熟,且文件不完整。
- 模型需求:1 百萬 token 的上下文視窗、多模態輸入,以及創新架構。
- 解決方案:Infra Agent 撰寫、測試並迭代低階程式碼,處理原本需資深工程師數週才能完成的任務。
- 成果:GLM‑5.3‑Flash 的所有生產推理皆運行於此自訂叢集,使其成為 OpenCode 與 OpenRouter 上使用最廣泛的模型,代號為 Ox‑Alpha。
3. 密集反饋:將稀疏指標轉化為可操作的指引
"反饋必須是局部的、低成本的,且可客觀驗證。" – Z‑AI 博客
3.1. 局部 vs. 端到端驗證
- 端到端指標(例如吞吐量)僅指出「有問題」,但無法說明「為何出問題」。
- 密集反饋 提供:
- 正確性測試 – 核心層級的數值比較。
- 執行時間日誌與執行追蹤 – 精確定位閒置期間、競爭或錯誤排程的傳輸。
- 微基準測試 – 隔離特定核心或輸入形狀的效能表現。
- Infra Agent 為每個假設選擇最合適的驗證方法,避免每次變更都進行耗時的完整服務部署。
3.2. 有效反饋的特徵
| 特徵 | 外觀 | 為何重要 |
|---|---|---|
| 局部 | "核心 X 在分割後於形狀 (64, 1024) 上產生 0.3 % 的錯誤。" | |
| 將搜尋空間縮小至單一程式路徑。 | ||
| 低成本 | 5 ms 的微基準測試在數秒內完成,而非數分鐘。 | |
| 支援快速迭代,並及早排除不良想法。 | ||
| 客觀 | 與具明確定義容差的參考實作進行比較。 | |
| 確保觀察到的改善是真實的,而非巧合。 |
4. 實例說明密集反饋
4.1. 正確性反饋 – 修復數值準確性錯誤
- 問題:KDA 核心的上下文平行(CP)路徑預設使用 TF32,導致長上下文中的錯誤累積。
- 反饋迴圈:
- 將平行策略對應至特定核心。
- 比較分割與未分割核心的輸出,發現錯誤超過 1 %。
- 檢查後確認 TF32 精度為罪魁禍首。
- 修正:將兩個點積的
input_precision="tf32x3",在保留 Tensor Core 速度的同時提升準確性。
- 結果:數值錯誤完全消除;修正已合併至上游(見 PR #1180)。
4.2. 系統行為反饋 – 解決 KV 傳輸併發瓶頸
- 問題:Prefill + KV 傳輸的延遲比僅 Prefill 基準高出超過 20 %。
- 反饋迴圈:
- 定義測試情境(Prefill、Prefill + KV、Decode),並設定 5 % 的效能預算。
- 執行追蹤分析顯示,Python 側的 KV 傳輸從未與 DeepEP 的調度/合併階段重疊。
- 根本原因:C++ 呼叫(
intranode_dispatch、intranode_combine)持有 Python GIL,阻擋了傳輸執行緒。 - 修正:在這些呼叫期間釋放 GIL。
- 結果:差距降至 <1 %;端到端吞吐量相應提升。
4.3. 性能反饋 – 核心層級優化傳播至系統增益
- 問題:基準 KDA 解碼核心存在冗餘運算與次佳的分塊策略。
- 反饋迴圈:
- 代理吸收來自現有核心(SGLang、Flash Linear Attention、DeepGEMM)的「優化骨架」。
- 消融實驗識別出三個改進階段(ReplaySSM 取捨、除法優化、分塊合併)。
- 最終版本將四個 V 維分塊合併為單一執行緒區塊,保持中間結果於暫存器中,並以 warp 層級的歸約取代每分塊歸約。
- 結果:相比前一版本提升 1.71 倍;累積的核心優化貢獻於整體 3 倍服務層級吞吐量提升。
5. 推動 3 倍提升的架構與優化
| 技術 | 描述 | 影響 |
|---|---|---|
| 節點內張量平行(線性注意力與語言模型頭) | 在節點內的加速器之間分割運算。 | 減少單一裝置的記憶體壓力。 |
| ReplaySSM | 以計算週期換取減少記憶體頻寬。 | 支援更大的上下文視窗。 |
| W8A8 量化 | 8 位元權重與激活表示。 | 減少記憶體流量。 |
| 混合精度快取(INT8/FP8/BF16) | 動態選擇每層的快取精度。 | 平衡準確性與頻寬。 |
| 層級拆分 | 將重載層分離至專用裝置。 | 提升使用率。 |
| Encode‑Prefill‑Decode(EPD)解耦 | 解耦三個推理階段,允許獨立擴展。 | 改善流水線平行與延遲。 |
6. 人類在迴圈中的角色
- 目標定義 – 工程師設定效能目標、安全限制與風險容忍度。
- 反饋環境設計 – 工程師提供代理可消耗的正確日誌、測試與微基準。
- 關鍵審查 – 人類審核數值安全性變更、併發性修復,以及任何可能影響生產穩定性的程式碼。
- 結果 – 代理提出、實作並驗證變更;人類僅批准符合正確性、穩定性與業務標準的變更。
7. 對 AI 驅動系統工程未來的影響
- GLM‑5.3‑Flash 的推出證明,當搭配密集反饋迴圈時,模型驅動的程式碼生成可取代傳統基礎設施工程的大部分工作。
- 三週的開發窗口顯示,未來模型的世代可能將工程週期從數月縮短至數天,加速更大模型的推出。
- 雖然真正的遞迴自我改進(RSI)仍是研究前沿,但此工作展現了一條 實用且逐步的途徑:首先自動化低階優化,再讓模型影響更高層級的系統設計。
- 此方法與硬體無關;類似的密集反饋管道可應用於 NVIDIA、AMD 或新興 ASIC 堆疊,可能 全球性地壓平人工智慧推理的成本曲線。
8. 社群反應(選摘 HN 評論)
"美國晶片出口限制可能反而成為中國人工智慧基礎設施的優勢。中國企業被迫加速開發自己的人工智慧晶片。" – zicohacks
"我們在超過 100,000 個中國製人工智慧加速器的叢集中,從零開始建構了一個完整的生產級推理服務。GLM‑5.3‑Flash 的所有生產推理皆運行於此系統。" – dada216
"令人印象深刻的是,他們能在相同硬體上榨取出如此多的效能。我猜測,同樣的過程將會在所有大型語言模型、推理提供者與硬體堆疊的組合中重演。" – a11r
這些評論凸顯了此工作的戰略意義,以及普遍認為激進的軟體優化可彌補硬體限制的信念。
9. 結論
GLM‑5.3‑Flash 的推理基礎設施展現了一種 新的工程典範,其中人工智慧模型主動參與建構與優化其運行的系統本身。透過將稀疏的端到端指標轉化為密集、局部且可驗證的反饋,Infra Agent 成功:
- 識別並修復數值正確性錯誤。
- 解決跨層併發問題。
- 在規模上應用核心層級優化知識。
結果——在不到兩週內於 100k 加速器叢集上實現三倍吞吐量提升——證明了 以反饋驅動、AI 協助的開發能大幅加速人工智慧基礎設施的進展。人類監督對安全與戰略方向仍至關重要,但通往遞迴自我改進的道路如今已明顯縮短。
Sources
相關
- Dispatch
- 專案
- Dispatch
- Dispatch
- Dispatch