中國開源 AI 生態系統的架構選擇:從 DeepSeek R1 到硬體優先、MoE 驅動的格局

TL;DR – DeepSeek 時刻之後發生了什麼?

在 DeepSeek R1 開源一年後,中國的 AI 社群已從追求單一模型的最強性能,轉向構建「靈活、具成本效益且感知硬體」的 AI 系統。

  • 混合專家模型 (MoE) 成為預設架構 – 它透過在每次請求時僅激活部分「專家」,讓大型模型保持可負擔的成本。
  • 多模態競賽爆發 – 文字轉圖像、影片、音訊、3D 和代理 (agent) 模型並行發布,且每個模型都附帶完整的工具鏈。
  • 小模型 (≤30 B) 激增 – 它們易於在本地運行、微調並嵌入業務工作流;大型 MoE 模型則作為蒸餾的「教師」網路。
  • Apache 2.0 / MIT 授權現在佔據主導地位 – 寬鬆的條款消除了法律摩擦,加速了商業採用。
  • 硬體優先思維 – 發布的版本現在都附帶針對國產晶片(華為 Ascend、寒武紀 Cambricon、崑崙 Kunlun 等)優化的量化、推理和服務堆棧,且訓練流程也公開記錄。

這些趨勢表明,競爭優勢正從原始模型規模轉向系統設計、部署效率和開源生態系統整合

1. MoE – 首選架構

「強大的推理能力可以是開源的、可重現的,並能在實踐中實現工程化。」 – DeepSeek R1 團隊

  • 為什麼選擇 MoE? 它將龐大的參數池劃分為許多專家,並進行稀疏激活。單次推理僅觸及總計算量的一小部分,在保持 100B 以上模型能力的同時,大幅降低了推理成本。
  • 現實影響:Kimi K2MiniMax M2Qwen-3 等模型都採用了 MoE,實現了:
    • 每次請求的計算動態縮放(簡單查詢 vs. 複雜推理)。
    • 在異構硬體上部署 – 廉價的邊緣設備可以透過使用較少的專家來運行相同的模型。
  • 戰略結果: 中國優先考慮可持續的性能而非絕對的基準測試霸權,這符合有限的計算預算和出口管制壓力。

2. 多模態軍備競賽

「影片生成工具、3D 組件、蒸餾數據集和代理框架的並行出現,指向了可重用的系統級能力。」 – 部落格作者

模態 值得關注的開源發布 (2025-2026) 關鍵特性
文字轉圖像 / 圖像轉影片 Step-1X-Edit, Hunyuan Video 高保真生成、編輯 API、邊緣到雲端的流水線
音訊 / 語音轉語音 Step-Audio-R1.1, Step-Audio-R1 最先進的 TTS 與語音轉換、開放評估套件
3D 與虛擬世界 Hunyuan 3D, GLM-Image (視覺增強) Mesh 生成、紋理合成、即時渲染支持
代理 / 工具使用 各種開源代理框架 (例如 LangChain-China) 整合的工具調用、記憶和規劃模組

社群不再僅僅發布權重。每一次發布都包含了:

  • 針對多種運行時 (ONNX, TensorRT, FastDeploy) 的推理腳本
  • 跨模態微調的數據集流水線
  • 評估框架 (例如多模態基準測試、人機協作測試)。

3. 小模型 – 核心主力層

「在計算資源有限或有嚴格合規要求的環境中,這些模型更適合長期運行。」

  • 參數範圍: 0.5 B – 30 B。
  • 為什麼它們很重要:
    • 易於在單個 GPU 甚至高端 CPU 上運行。
    • 更快的微調 → 更快的產品迭代。
    • 更低的合規風險 (較小的攻擊面,更容易審計)。
  • 生態系統模式: 大型 MoE 模型 (100 B – 700 B) 作為教師網路。知識被蒸餾到數十個緊湊的模型中,形成一個金字塔
    • 頂層: 大型 MoE 模型 – 研究展示,能力天花板。
    • 中層: 30 B-70 B 蒸餾模型 – 用於 SaaS 的高品質 API。
    • 底層: ≤30 B 模型 – 本地部署、邊緣和嵌入式應用。
  • 社群指標: Hugging Face 月度摘要中,小模型的下載佔比從 ~35% (2025 年初) 增長到 >55% (2026 年中)。

4. 授權自由化 – Apache 2.0 接管

「更寬鬆的授權降低了在生產環境中使用、修改和部署模型的摩擦。」

  • DeepSeek R1 之前: 混合了自定義、限制性授權 (例如 CC-BY-NC-SA)。法律不確定性減緩了企業採用。
  • 之後: Apache 2.0 和 MIT 成為中國開源 AI 模型的事實標準
  • 影響:
    • 公司可以在不重新授權的情況下將模型嵌入專有產品中。
    • 雲端供應商可以在國產基礎設施上提供「模型即服務」,而無需逐個模型協商條款。
    • 跨境學術合作變得更加順暢 (與 GPL、BSD 等授權兼容)。
  • 數據點: 在「開源熱力圖」中,Apache 授權發布的比例從 12% (2025 年 1 月) 跳升至 68% (2026 年 10 月)

5. 從模型優先轉向硬體優先

「一個顯著的目標不再僅僅是讓權重可供下載,而是確保模型可以直接在目標國產硬體上運行。」

5.1 推理優先套件

  • 零天硬體支持 – DeepSeek-V3.2-Exp 發布時就附帶了適用於 Huawei AscendCambricon 晶片的即用二進制文件。
  • 量化流水線 – 發布的模型包含針對特定 ASIC 優化的 INT4/INT8 版本,大幅降低了延遲和功耗。
  • 服務堆棧:
    • Mooncake (Moonshot AI) – 開源的預填充/解碼分離,具備 GPU/CPU 感知調度功能。
    • FastDeploy 2.0 (Baidu) – 極致量化 + 集群級優化。
    • Qwen 生態系統 (Alibaba) – 從模型倉庫 → Docker 鏡像 → 雲端部署的端到端 CI/CD。

5.2 訓練端透明化

  • 螞蟻集團 – Ling: 記錄了使用國產 AI 晶片後,每兆兆 (trillion) token 的成本降低了 5%。
  • 百度 – Qianfan-VL: 發布了包含 5,000 個節點 Kunlun P800 集群的完整拓撲結構,包括流水線並行策略。
  • 智譜 – GLM-Image 與 電信 – TeleChat3: 兩者都宣佈了完全使用國產晶片訓練,這標誌著中國的晶片生態系統現在已支持兆級 token 模型的完整訓練堆棧。

5.3 戰略意義

  • 對抗出口管制的韌性: 透過模型與晶片的協同優化,中國企業降低了對 NVIDIA/H100 級別 GPU 的依賴。
  • 生態系統鎖定: 開源服務工具 (Mooncake, FastDeploy) 與國產硬體 SDK 緊密耦合,形成了採用上的良性循環。
  • 剩餘瓶頸: 計算資源短缺的報告 (例如智譜限制註冊) 顯示,硬體供應仍落後於需求,這是擴張的風險。

6. 重構進行中 – 新的競爭格局

「中國公司不再僅僅優化孤立的模型。相反,他們正在追求不同的架構路徑,旨在為開源世界構建完整的生態系統。」

  • 系統級競爭 已超越了原始的基準測試競賽。成功衡量標準為:
    1. 每次查詢的部署成本 (USD/1M tokens)。
    2. 微調變體的上市時間 (天 vs. 週)。
    3. 硬體無關的可移植性 (單一倉庫可在 Ascend, Cambricon 和 NVIDIA 上運行)。
  • 開源作為戰略資產: 透過不僅發布權重,還發布整個堆棧 (數據集、訓練腳本、推理引擎),企業創造了吸引開發者、初創公司和學術界的網絡效應。
  • 未來展望 (2026+):
    • 混合 MoE-量化模型,可針對每個專家動態切換精度。
    • 以邊緣為中心的代理,在低功耗 ASIC 上運行以實現即時決策。
    • 跨模態蒸餾流水線,將多模態教師壓縮成統一的小模型。

給研究人員、開發者和政策制定者的啟示

  1. 專注於系統設計 – 在為開源 AI 做貢獻時,優先考慮可重現的流水線、感知硬體的量化和服務腳本。
  2. 利用小模型 – 它們主導著現實世界的部署;從大型 MoE 教師進行蒸餾是實現高品質的成熟路徑。
  3. 關注授權 – Apache 2.0 和 MIT 將仍是商業整合最安全的選擇。
  4. 監控硬體政策 – 出口管制的變化將繼續重塑大規模訓練發生的地點和方式。
  5. 跨模態協作 – 多模態開源項目正在融合;跨模態數據集和評估套件正在成為社群標準。

DeepSeek 時刻引發了中國 AI 生態系統的重新架構:從孤立的單體模型,轉向一個平衡能力、成本和戰略獨立性的分層、硬體優先的開源堆棧。

Sources