全球運算格局的轉移:中國在AI硬體與軟體的崛起

美國出口管制對先進AI晶片的限制作為催化劑,促使中國發展自給自足的AI生態系統,加速國產硬體的生產和高計算效率開放權重模型的創造。此轉移正將全球AI格局從以美國為中心的模型移向中國維持可行的平行基礎設施,用於訓練和部署。

全球運算的現狀

對先進AI晶片的需求在全球持續上升,但NVIDIA長期的主導地位正受到中國為國產自給自足所進行的戰略推動的挑戰。中國下一代開放權重AI模型越來越多地由國產晶片驅動,改變了全球AI訓練和部署的規範。

此轉變受到美國和中國國家安全顧慮的推動,導致對晶片和稀土資源的限制。隨著美國出口管制的收緊,中國國產晶片的推出加速,導致更多模型針對本地硬體進行優化,以及計算效率高的開放權重模型採用的激增。

催化劑:美國出口管制與國內創新

拜登政府在2022年建立的出口管制,原本旨在通過限制對高端GPU的訪問來遲滯中國的AI進展,反而為蓬勃發展的國內產業奠定了基礎。中國AI實驗室面臨被切斷的威脅,在硬體和軟體兩方面爆發了創新浪潮。

國內硬體的崛起

中國已開發出幾款顯著的先進晶片,以取代NVIDIA GPU,包括:

  • Huawei Ascend:最初於2018年推出,並在2024年和2025年擴大部署。
  • Cambricon TechnologiesBaidu Kunlun:國內晶片格局中的其他關鍵參與者。

開放權重模型的增長

計算資源的稀缺促使中國實驗室優先考慮架構效率和開放協作。這種務實的「非-NVIDIA優先」方法促成了世界級的開放權重模型,如 QwenDeepSeekGLMKimi。在本地運行這些模型的能力在晶片製造商和研究人員之間創造了回饋循環,導致硬體優化的模型,例如針對Ascend平台優化的模型。

在計算受限環境中的技術突破

計算限制激發了顯著的架構和基礎設施進步,這些進步現在已影響全球AI的發展。

演算法和架構效率

  • DeepSeek:引入了 Multi-head Latent Attention (MLA)DeepSeek Sparse Attention (DSA),以降低推理成本而不犧牲性能。DeepSeek 也開發了 Group Relative Policy Optimization (GRPO),這是一種相較於 Proximal Policy Optimization (PPO) 能降低計算成本的強化學習(RL)方法。GRPO 已被 Meta 研究人員採用,並獲得 OpenAI 的 Jerry Tworek 的讚譽,因其加速了RL研究。
  • Linear Attention:像 Peng Bo 這樣的研究者倡導 Linear Attention 作為 Transformer 的後繼者,這在模型如 RWKV 中可見,並且在商業模型如 MiniMax M1Qwen-Next 中得到擴展。

開放基礎設施與工程

中國實驗室已從企業保密轉向分享工程秘訣以加速進展:

  • Kimi:開發了用於 prefill/decoding 分離的 Mooncake 服務系統。
  • StepFun:在 Step3 中透過 Attention-FFN Disaggregation (AFD) 加強了此系統。
  • ByteDance:貢獻了 verl,一個用於生產級RL訓練的開源庫。
  • Baidu:發表了詳細的技術報告,說明如何克服 Ernie 4 的工程挑戰。

平行軟體生態系統的出現

NVIDIA 的主導地位不僅建立在硬體上,也建立在 CUDA 軟體生態系統上。中國現在正在開發後端中立的替代方案,以挑戰這種依賴。

從充足到需求

DeepSeek 的 R1 模型在華為 Ascend 雲端上無縫運行的示範點燃了全市場範圍的競賽,以將國產模型優化為國產晶片。這證明了國產晶片對於前沿AI是足夠的,將本地硬體的感知從一種小眾替代品轉變為被需求的資產。

硬體-軟體共同設計

研究者現在正與晶片廠商共同開發模型。例如,DeepSeek-V3.1 的 FP8 精度格式 是專門為下一代國產晶片設計的,而 DeepSeek-V3.2 使用了 TileLang-based kernels 以在多個硬體廠商間實現可移植性。

挑戰 CUDA 堆疊

新興的軟體層正在取代 NVIDIA 堆疊:

  • FlagGems (BAAI) 和 TileLang:CUDA 和 cuDNN 的後端中立替代方案。
  • Huawei Collective Communication Library (HCCL):NVIDIA NCCL 的替代品。

計算管制與市場變遷時間線

  • October 2022:美國工業與安全局(BIS)對 A100 和 H100 GPU 引入管制。
  • Late 2022–2023:NVIDIA 創建符合規範的變體(A800、H800、RTX 4090D),帶寬度降低。
  • Late 2023–2024:BIS 將框架升級為總處理效能(TPP)和效能密度,針對 A800/H800。
  • January 2025:「DeepSeek 時刻」加速了 Ascend、Cambricon 和 Kunlun 晶片的採用。
  • April–May 2025:美國對 NVIDIA 晶片發布許可證需求,收取 55億美元,之後在五月撤銷了 AI Diffusion Rule。
  • August 2025:美國商務部實施 H20 授權的 15% 收入分成安排。
  • Late 2025:中國監管機構據稱指示公司取消 NVIDIA 訂單,以優先考慮國產加速器。

Sources