グローバルコンピューティング環境の変化:中国のAIハードウェアとソフトウェアの台頭
米国の先進AIチップに対する輸出規制は、中国が自給自足のAIエコシステムを開発するきっかけとなり、国内ハードウェアの生産と高度に計算効率の高いオープンウェイトモデルの創出を加速させました。この変化は、米国中心のモデルから、中国が訓練と展開のための実行可能な並行インフラストラクチャを維持する方向へとグローバルAI環境を移動させています。
グローバルコンピューティングの現状
先進AIチップへの需要は世界的に増加し続けていますが、NVIDIAの長年の優位性は、中国の国内自給自足への戦略的推進によって挑戦されています。次世代の中国オープンウェイトAIモデルは、国内チップによってますます駆動され、グローバルなAIトレーニングと展開の規範が変化しています。
この移行は、米国と中国の両方の国家安全保障上の懸念によって推進され、チップとレアアース資源への制限をもたらしています。米国の輸出規制が強化されるにつれ、中国製チップの導入が加速し、その結果、ローカルハードウェア向けに最適化されたモデルが増え、計算効率の高いオープンウェイトモデルの採用が急増しています。
催化剂:米国輸出規制と国内イノベーション
2022年にバイデン政権が制定した輸出規制は、ハイエンドGPUへのアクセスを制限することで中国のAI進歩を停滞させる意図でしたが、代わりに急成長する国内産業の基盤を築きました。中国のAIラボは、遮断される脅威に対して、ハードウェアとソフトウェアの両方で革新の波を起こしました。
国内ハードウェアの台頭
中国は、NVIDIA GPUを置き換えるいくつかの注目すべき先進チップを開発しており、以下が含まれます:
- Huawei Ascend:最初に2018年に発売され、2024年と2025年にわたって拡張導入されています。
- Cambricon Technologies と Baidu Kunlun:国内チップ環境におけるその他の主要プレイヤー。
オープンウェイトモデルの成長
計算リソースの不足により、中国のラボはアーキテクチャの効率性とオープンコラボレーションを優先しました。この実践的な「非NVIDIA第一」アプローチにより、Qwen、DeepSeek、GLM、Kimi といった世界クラスのオープンウェイトモデルが生まれました。これらのモデルをローカルで実行できるようになったことで、チップメーカーと研究者の間にフィードバックループが生まれ、Ascendプラットフォーム向けに最適化されたハードウェア最適化モデルなどが生まれています。
計算制約環境における技術的ブレイクスルー
計算制限は、現在グローバルなAI開発に影響を与えている重要なアーキテクチャおよびインフラストラクチャの進歩を促しました。
アルゴリズムとアーキテクチャの効率性
- DeepSeek:Multi-head Latent Attention (MLA) と DeepSeek Sparse Attention (DSA) を導入し、パフォーマンスを犠牲にすることなく推論コストを削減しました。DeepSeekはまた、Group Relative Policy Optimization (GRPO) という強化学習(RL)手法を開発し、Proximal Policy Optimization (PPO) と比較して計算コストを削減しました。GRPOはMetaの研究者によって採用され、OpenAIのJerry TworekによってRL研究の加速を称賛されています。
- Linear Attention:Peng Bo などの研究者が、Transformerの後継としてLinear Attentionを提唱しており、RWKV モデルに見られ、商用モデルである MiniMax M1 と Qwen-Next にスケールされています。
オープンインフラストラクチャとエンジニアリング
中国のラボは、企業の秘密主義からエンジニアリングの秘密を共有して進歩を加速する方向にシフトしています:
- Kimi:プリフィル/デコードの分離のための Mooncake サービングシステムを開発しました。
- StepFun:これに Attention-FFN Disaggregation (AFD) をStep3で追加して強化しました。
- ByteDance:本番グレードのRLトレーニング用のオープンソースライブラリ verl を提供しました。
- Baidu:Ernie 4 のエンジニアリング課題を克服するための詳細な技術レポートを公開しました。
並行ソフトウェアエコシステムの出現
NVIDIAの優位性は、ハードウェアだけでなくCUDAソフトウェアエコシステムにも築かれていました。中国は現在、この依存に挑戦するバックエンドニュートラルな代替手段を開発しています。
十分性から需要へ
DeepSeekのR1モデルがHuaweiのAscendクラウドでシームレスに動作することの実証は、国内モデルを国内チップ向けに最適化する市場全体の競争を引き起こしました。これは、国内シリコンがフロンティアAIに十分であることを証明し、ローカルハードウェアの認識をニッチな代替から求められる資産へと変化させました。
ハードウェア・ソフトウェア共同設計
研究者は現在、チップベンダーとモデルを共同開発しています。たとえば、DeepSeek-V3.1の FP8精度フォーマット は次世代国内チップ向けに特別に設計され、DeepSeek-V3.2は TileLangベースのカーネル を利用して複数のハードウェアベンダー間での移植性を実現しています。
CUDAスタックへの挑戦
NVIDIAスタックを置き換える新しいソフトウェアレイヤーが登場しています:
- FlagGems (BAAI) と TileLang:CUDAとcuDNNのバックエンドニュートラルな代替手段。
- Huawei Collective Communication Library (HCCL):NVIDIAのNCCLの代替品。
コンピューティング規制と市場変化のタイムライン
- 2022年10月:米国商務部産業安全保障局(BIS)がA100およびH100 GPUへの規制を導入。
- 2022年末~2023年:NVIDIAが帯域幅を削減した準拠バリアント(A800、H800、RTX 4090D)を作成。
- 2023年末~2024年:BISがフレームワークをTotal Processing Performance (TPP)とパフォーマンス密度にアップグレードし、A800/H800を対象。
- 2025年1月:「DeepSeek moment」がAscend、Cambricon、Kunlunチップの採用を加速。
- 2025年4月~5月:米国がNVIDIAチップのライセンス要件を発行し、55億ドルの料金を課すが、5月にAI Diffusion Ruleを撤回。
- 2025年8月:米国商務部がH20ライセンスに対して15%の収益分配の仕組みを実施。
- 2025年末:中国の規制当局が reportedly 企業にNVIDIAの注文をキャンセルし、国内アクセラレータを優先するよう指示。