变化的全球算力格局:中国在 AI 硬件与软件领域的崛起

美国对先进 AI 芯片的出口管制已成为中国发展自主 AI 生态系统的催化剂,加速了国产硬件的生产以及高计算效率开源权重模型的创建。这一转变正使全球 AI 格局从以美国为中心的模式,转向中国维持一个可行的、平行的训练与部署基础设施的模式。

全球算力现状

全球对先进 AI 芯片的需求持续增长,但 NVIDIA 的长期统治地位正受到中国推动实现自主可控战略的挑战。下一代中国开源权重 AI 模型正越来越多地由国产芯片驱动,正在改变全球 AI 训练与部署的规范。

这种转型是由美中两国的国家安全考量驱动的,导致了对芯片和稀土资源的限制。随着美国出口管制的收紧,国产芯片的推出得以加速,导致更多模型针对本地硬件进行了优化,并引发了对高计算效率开源权重模型的采用热潮。

催化剂:美国出口管制与本土创新

拜登政府在 2022 年建立的出口管制旨在通过限制获取高端 GPU 来遏制中国的 AI 进展,但反而为蓬勃发展的本土产业奠定了基础。中国 AI 实验室对被切断供应的威胁做出了反应,在硬件和软件领域都爆发了创新浪潮。

国产硬件的崛起

中国已经开发出几种显著的先进芯片来替代 NVIDIA GPU,包括:

  • Huawei Ascend:最初于 2018 年推出,并在 2024 年至 2025 年期间扩大部署。
  • Cambricon TechnologiesBaidu Kunlun:国产芯片领域中的其他关键参与者。

开源权重模型的增长

算力的匮乏促使中国实验室优先考虑架构效率和开放协作。这种务实的“非 NVIDIA 优先”方法催生了世界级的开源权重模型,如 QwenDeepSeekGLMKimi。在本地运行这些模型的能力在芯片制造商和研究人员之间建立了反馈循环,从而产生了针对硬件优化的模型,例如针对 Ascend 平台优化的模型。

计算受限环境下的技术突破

算力限制激励了重大的架构和基础设施进步,这些进步现在已经影响了全球 AI 的发展。

算法与架构效率

  • DeepSeek:引入了 Multi-head Latent Attention (MLA)DeepSeek Sparse Attention (DSA),在不牺牲性能的情况下降低了推理成本。DeepSeek 还开发了 Group Relative Policy Optimization (GRPO),这是一种强化学习 (RL) 方法,与 Proximal Policy Optimization (PPO) 相比降低了计算成本。GRPO 已被 Meta 的研究人员采用,并因加速 RL 研究而受到 OpenAI 的 Jerry Tworek 的赞赏。
  • Linear Attention:像 Peng Bo 这样的研究人员倡导将 Linear Attention 作为 Transformer 的继任者,这已出现在 RWKV 等模型中,并在 MiniMax M1Qwen-Next 等商业模型中进行了规模化应用。

开放基础设施与工程

中国实验室已从企业秘密转向分享工程秘密以加速进展:

  • Kimi:开发了用于预填充/解码分离的 Mooncake 服务系统。
  • StepFun:在 Step3 中通过 Attention-FFN Disaggregation (AFD) 增强了这一点。
  • ByteDance:贡献了 verl,这是一个用于生产级 RL 训练的开源库。
  • Baidu:发布了关于克服 Ernie 4 工程挑战的详细技术报告。

平行软件生态系统的出现

NVIDIA 的统治地位不仅建立在硬件上,还建立在 CUDA 软件生态系统之上。中国目前正在开发中立于后端的替代方案,以挑战这种依赖。

从满足需求到需求驱动

DeepSeek 的 R1 模型在华为 Ascend 云上无缝运行的演示,引发了全市场优化国产模型以适配国产芯片的竞赛。这证明了国产硅片足以应对前沿 AI,将本地硬件的认知从利基替代品转变为需求资产。

软硬件协同设计

研究人员现在正与芯片供应商共同开发模型。例如,DeepSeek-V3.1 的 FP8 precision format 是专门为下一代国产芯片设计的,而 DeepSeek-V3.2 利用 TileLang-based kernels 来实现跨多个硬件供应商的可移植性。

挑战 CUDA 技术栈

新的软件层正在涌现以取代 NVIDIA 技术栈:

  • FlagGems (BAAI) 和 TileLang:CUDA 和 cuDNN 的中立后端替代方案。
  • Huawei Collective Communication Library (HCCL):NVIDIA NCCL 的替代品。

算力管制与市场转变时间线

  • 2022 年 10 月:美国工业和安全局 (BIS) 对 A100 和 H100 GPU 实施管制。
  • 2022 年底–2023 年:NVIDIA 推出了带宽降低的合规变体 (A800, H800, RTX 4090D)。
  • 2023 年底–2024 年:BIS 将框架升级为总处理性能 (TPP) 和性能密度,目标直指 A800/H800。
  • 2025 年 1 月:“DeepSeek 时刻”加速了 Ascend、Cambricon 和 Kunlun 芯片的采用。
  • 2025 年 4 月–5 月:美国对 NVIDIA 芯片发布许可要求,收费 55 亿美元,随后在 5 月撤销了 AI Diffusion Rule。
  • 2025 年 8 月:美国商务部对 H20 许可实施 15% 的收入分成安排。
  • 2025 年底:据报道,中国监管机构指示企业取消 NVIDIA 订单,以优先考虑国产加速器。

Sources