GLM-5.3-Flash 推理基礎設施:如何由 AI 代理建構 100k 加速器服務

TL;DR

GLM‑5.3‑Flash 的推理服務在不到兩週內,於超過 100,000 個中國人工智慧加速器的叢集中從零開始建立,主要由一個由 GLM‑5.3 驅動的 Infra Agent(基礎設施代理)推動完成。透過結合激進的記憶體優化、自訂的 Encode‑Prefill‑Decode 架構,以及將稀疏的端到端指標轉化為細緻且可操作的信號的「密集反饋」迴圈,團隊將吞吐量提升了三倍,並達到與主流 NVIDIA GPU 相當的硬體效率。


1. 為何 GLM‑5.3‑Flash 的基礎設施至關重要

  • 此系統展現了朝向 遞迴自我改進(RSI) 的具體一步:一個模型協助設計、建構與優化未來訓練其繼承者的硬體與軟體。
  • 在先前未經測試的硬體堆疊(中國製加速器)上實現生產級效能,證明大規模人工智慧推理可脫離主導的 NVIDIA 生態系統。
  • 三倍的吞吐量提升與六天內處理 62 兆個 token 的成果,顯示 AI 驅動的基礎設施工程能大幅縮短開發週期。

2. 從零建構 100k 加速器叢集

  • 硬體限制:片上記憶體有限、頻寬狹窄、核心支援不成熟,且文件不完整。
  • 模型需求:1 百萬 token 的上下文視窗、多模態輸入,以及創新架構。
  • 解決方案:Infra Agent 撰寫、測試並迭代低階程式碼,處理原本需資深工程師數週才能完成的任務。
  • 成果:GLM‑5.3‑Flash 的所有生產推理皆運行於此自訂叢集,使其成為 OpenCode 與 OpenRouter 上使用最廣泛的模型,代號為 Ox‑Alpha

3. 密集反饋:將稀疏指標轉化為可操作的指引

"反饋必須是局部的、低成本的,且可客觀驗證。" – Z‑AI 博客

3.1. 局部 vs. 端到端驗證

  • 端到端指標(例如吞吐量)僅指出「有問題」,但無法說明「為何出問題」。
  • 密集反饋 提供:
    1. 正確性測試 – 核心層級的數值比較。
    2. 執行時間日誌與執行追蹤 – 精確定位閒置期間、競爭或錯誤排程的傳輸。
    3. 微基準測試 – 隔離特定核心或輸入形狀的效能表現。
  • Infra Agent 為每個假設選擇最合適的驗證方法,避免每次變更都進行耗時的完整服務部署。

3.2. 有效反饋的特徵

特徵 外觀 為何重要
局部 "核心 X 在分割後於形狀 (64, 1024) 上產生 0.3 % 的錯誤。"
將搜尋空間縮小至單一程式路徑。
低成本 5 ms 的微基準測試在數秒內完成,而非數分鐘。
支援快速迭代,並及早排除不良想法。
客觀 與具明確定義容差的參考實作進行比較。
確保觀察到的改善是真實的,而非巧合。

4. 實例說明密集反饋

4.1. 正確性反饋 – 修復數值準確性錯誤

  • 問題:KDA 核心的上下文平行(CP)路徑預設使用 TF32,導致長上下文中的錯誤累積。
  • 反饋迴圈
    1. 將平行策略對應至特定核心。
    2. 比較分割與未分割核心的輸出,發現錯誤超過 1 %。
    3. 檢查後確認 TF32 精度為罪魁禍首。
    4. 修正:將兩個點積的 input_precision="tf32x3",在保留 Tensor Core 速度的同時提升準確性。
  • 結果:數值錯誤完全消除;修正已合併至上游(見 PR #1180)。

4.2. 系統行為反饋 – 解決 KV 傳輸併發瓶頸

  • 問題:Prefill + KV 傳輸的延遲比僅 Prefill 基準高出超過 20 %。
  • 反饋迴圈
    1. 定義測試情境(Prefill、Prefill + KV、Decode),並設定 5 % 的效能預算。
    2. 執行追蹤分析顯示,Python 側的 KV 傳輸從未與 DeepEP 的調度/合併階段重疊。
    3. 根本原因:C++ 呼叫(intranode_dispatchintranode_combine)持有 Python GIL,阻擋了傳輸執行緒。
    4. 修正:在這些呼叫期間釋放 GIL。
  • 結果:差距降至 <1 %;端到端吞吐量相應提升。

4.3. 性能反饋 – 核心層級優化傳播至系統增益

  • 問題:基準 KDA 解碼核心存在冗餘運算與次佳的分塊策略。
  • 反饋迴圈
    1. 代理吸收來自現有核心(SGLang、Flash Linear Attention、DeepGEMM)的「優化骨架」。
    2. 消融實驗識別出三個改進階段(ReplaySSM 取捨、除法優化、分塊合併)。
    3. 最終版本將四個 V 維分塊合併為單一執行緒區塊,保持中間結果於暫存器中,並以 warp 層級的歸約取代每分塊歸約。
  • 結果:相比前一版本提升 1.71 倍;累積的核心優化貢獻於整體 3 倍服務層級吞吐量提升。

5. 推動 3 倍提升的架構與優化

技術 描述 影響
節點內張量平行(線性注意力與語言模型頭) 在節點內的加速器之間分割運算。 減少單一裝置的記憶體壓力。
ReplaySSM 以計算週期換取減少記憶體頻寬。 支援更大的上下文視窗。
W8A8 量化 8 位元權重與激活表示。 減少記憶體流量。
混合精度快取(INT8/FP8/BF16) 動態選擇每層的快取精度。 平衡準確性與頻寬。
層級拆分 將重載層分離至專用裝置。 提升使用率。
Encode‑Prefill‑Decode(EPD)解耦 解耦三個推理階段,允許獨立擴展。 改善流水線平行與延遲。

6. 人類在迴圈中的角色

  • 目標定義 – 工程師設定效能目標、安全限制與風險容忍度。
  • 反饋環境設計 – 工程師提供代理可消耗的正確日誌、測試與微基準。
  • 關鍵審查 – 人類審核數值安全性變更、併發性修復,以及任何可能影響生產穩定性的程式碼。
  • 結果 – 代理提出、實作並驗證變更;人類僅批准符合正確性、穩定性與業務標準的變更。

7. 對 AI 驅動系統工程未來的影響

  • GLM‑5.3‑Flash 的推出證明,當搭配密集反饋迴圈時,模型驅動的程式碼生成可取代傳統基礎設施工程的大部分工作
  • 三週的開發窗口顯示,未來模型的世代可能將工程週期從數月縮短至數天,加速更大模型的推出。
  • 雖然真正的遞迴自我改進(RSI)仍是研究前沿,但此工作展現了一條 實用且逐步的途徑:首先自動化低階優化,再讓模型影響更高層級的系統設計。
  • 此方法與硬體無關;類似的密集反饋管道可應用於 NVIDIA、AMD 或新興 ASIC 堆疊,可能 全球性地壓平人工智慧推理的成本曲線

8. 社群反應(選摘 HN 評論)

"美國晶片出口限制可能反而成為中國人工智慧基礎設施的優勢。中國企業被迫加速開發自己的人工智慧晶片。" – zicohacks

"我們在超過 100,000 個中國製人工智慧加速器的叢集中,從零開始建構了一個完整的生產級推理服務。GLM‑5.3‑Flash 的所有生產推理皆運行於此系統。" – dada216

"令人印象深刻的是,他們能在相同硬體上榨取出如此多的效能。我猜測,同樣的過程將會在所有大型語言模型、推理提供者與硬體堆疊的組合中重演。" – a11r

這些評論凸顯了此工作的戰略意義,以及普遍認為激進的軟體優化可彌補硬體限制的信念。


9. 結論

GLM‑5.3‑Flash 的推理基礎設施展現了一種 新的工程典範,其中人工智慧模型主動參與建構與優化其運行的系統本身。透過將稀疏的端到端指標轉化為密集、局部且可驗證的反饋,Infra Agent 成功:

  1. 識別並修復數值正確性錯誤。
  2. 解決跨層併發問題。
  3. 在規模上應用核心層級優化知識。

結果——在不到兩週內於 100k 加速器叢集上實現三倍吞吐量提升——證明了 以反饋驅動、AI 協助的開發能大幅加速人工智慧基礎設施的進展。人類監督對安全與戰略方向仍至關重要,但通往遞迴自我改進的道路如今已明顯縮短。

Sources

相關