中國開源 AI 生態系統的架構選擇:從 DeepSeek R1 到硬體優先、MoE 驅動的格局
TL;DR – DeepSeek 時刻之後發生了什麼?
在 DeepSeek R1 開源一年後,中國的 AI 社群已從追求單一模型的最強性能,轉向構建「靈活、具成本效益且感知硬體」的 AI 系統。
- 混合專家模型 (MoE) 成為預設架構 – 它透過在每次請求時僅激活部分「專家」,讓大型模型保持可負擔的成本。
- 多模態競賽爆發 – 文字轉圖像、影片、音訊、3D 和代理 (agent) 模型並行發布,且每個模型都附帶完整的工具鏈。
- 小模型 (≤30 B) 激增 – 它們易於在本地運行、微調並嵌入業務工作流;大型 MoE 模型則作為蒸餾的「教師」網路。
- Apache 2.0 / MIT 授權現在佔據主導地位 – 寬鬆的條款消除了法律摩擦,加速了商業採用。
- 硬體優先思維 – 發布的版本現在都附帶針對國產晶片(華為 Ascend、寒武紀 Cambricon、崑崙 Kunlun 等)優化的量化、推理和服務堆棧,且訓練流程也公開記錄。
這些趨勢表明,競爭優勢正從原始模型規模轉向系統設計、部署效率和開源生態系統整合。
1. MoE – 首選架構
「強大的推理能力可以是開源的、可重現的,並能在實踐中實現工程化。」 – DeepSeek R1 團隊
- 為什麼選擇 MoE? 它將龐大的參數池劃分為許多專家,並進行稀疏激活。單次推理僅觸及總計算量的一小部分,在保持 100B 以上模型能力的同時,大幅降低了推理成本。
- 現實影響: 如 Kimi K2、MiniMax M2 和 Qwen-3 等模型都採用了 MoE,實現了:
- 每次請求的計算動態縮放(簡單查詢 vs. 複雜推理)。
- 在異構硬體上部署 – 廉價的邊緣設備可以透過使用較少的專家來運行相同的模型。
- 戰略結果: 中國優先考慮可持續的性能而非絕對的基準測試霸權,這符合有限的計算預算和出口管制壓力。
2. 多模態軍備競賽
「影片生成工具、3D 組件、蒸餾數據集和代理框架的並行出現,指向了可重用的系統級能力。」 – 部落格作者
| 模態 | 值得關注的開源發布 (2025-2026) | 關鍵特性 |
|---|---|---|
| 文字轉圖像 / 圖像轉影片 | Step-1X-Edit, Hunyuan Video | 高保真生成、編輯 API、邊緣到雲端的流水線 |
| 音訊 / 語音轉語音 | Step-Audio-R1.1, Step-Audio-R1 | 最先進的 TTS 與語音轉換、開放評估套件 |
| 3D 與虛擬世界 | Hunyuan 3D, GLM-Image (視覺增強) | Mesh 生成、紋理合成、即時渲染支持 |
| 代理 / 工具使用 | 各種開源代理框架 (例如 LangChain-China) | 整合的工具調用、記憶和規劃模組 |
社群不再僅僅發布權重。每一次發布都包含了:
- 針對多種運行時 (ONNX, TensorRT, FastDeploy) 的推理腳本。
- 跨模態微調的數據集流水線。
- 評估框架 (例如多模態基準測試、人機協作測試)。
3. 小模型 – 核心主力層
「在計算資源有限或有嚴格合規要求的環境中,這些模型更適合長期運行。」
- 參數範圍: 0.5 B – 30 B。
- 為什麼它們很重要:
- 易於在單個 GPU 甚至高端 CPU 上運行。
- 更快的微調 → 更快的產品迭代。
- 更低的合規風險 (較小的攻擊面,更容易審計)。
- 生態系統模式: 大型 MoE 模型 (100 B – 700 B) 作為教師網路。知識被蒸餾到數十個緊湊的模型中,形成一個金字塔:
- 頂層: 大型 MoE 模型 – 研究展示,能力天花板。
- 中層: 30 B-70 B 蒸餾模型 – 用於 SaaS 的高品質 API。
- 底層: ≤30 B 模型 – 本地部署、邊緣和嵌入式應用。
- 社群指標: Hugging Face 月度摘要中,小模型的下載佔比從 ~35% (2025 年初) 增長到 >55% (2026 年中)。
4. 授權自由化 – Apache 2.0 接管
「更寬鬆的授權降低了在生產環境中使用、修改和部署模型的摩擦。」
- DeepSeek R1 之前: 混合了自定義、限制性授權 (例如 CC-BY-NC-SA)。法律不確定性減緩了企業採用。
- 之後: Apache 2.0 和 MIT 成為中國開源 AI 模型的事實標準。
- 影響:
- 公司可以在不重新授權的情況下將模型嵌入專有產品中。
- 雲端供應商可以在國產基礎設施上提供「模型即服務」,而無需逐個模型協商條款。
- 跨境學術合作變得更加順暢 (與 GPL、BSD 等授權兼容)。
- 數據點: 在「開源熱力圖」中,Apache 授權發布的比例從 12% (2025 年 1 月) 跳升至 68% (2026 年 10 月)。
5. 從模型優先轉向硬體優先
「一個顯著的目標不再僅僅是讓權重可供下載,而是確保模型可以直接在目標國產硬體上運行。」
5.1 推理優先套件
- 零天硬體支持 – DeepSeek-V3.2-Exp 發布時就附帶了適用於 Huawei Ascend 和 Cambricon 晶片的即用二進制文件。
- 量化流水線 – 發布的模型包含針對特定 ASIC 優化的 INT4/INT8 版本,大幅降低了延遲和功耗。
- 服務堆棧:
- Mooncake (Moonshot AI) – 開源的預填充/解碼分離,具備 GPU/CPU 感知調度功能。
- FastDeploy 2.0 (Baidu) – 極致量化 + 集群級優化。
- Qwen 生態系統 (Alibaba) – 從模型倉庫 → Docker 鏡像 → 雲端部署的端到端 CI/CD。
5.2 訓練端透明化
- 螞蟻集團 – Ling: 記錄了使用國產 AI 晶片後,每兆兆 (trillion) token 的成本降低了 5%。
- 百度 – Qianfan-VL: 發布了包含 5,000 個節點 Kunlun P800 集群的完整拓撲結構,包括流水線並行策略。
- 智譜 – GLM-Image 與 電信 – TeleChat3: 兩者都宣佈了完全使用國產晶片訓練,這標誌著中國的晶片生態系統現在已支持兆級 token 模型的完整訓練堆棧。
5.3 戰略意義
- 對抗出口管制的韌性: 透過模型與晶片的協同優化,中國企業降低了對 NVIDIA/H100 級別 GPU 的依賴。
- 生態系統鎖定: 開源服務工具 (Mooncake, FastDeploy) 與國產硬體 SDK 緊密耦合,形成了採用上的良性循環。
- 剩餘瓶頸: 計算資源短缺的報告 (例如智譜限制註冊) 顯示,硬體供應仍落後於需求,這是擴張的風險。
6. 重構進行中 – 新的競爭格局
「中國公司不再僅僅優化孤立的模型。相反,他們正在追求不同的架構路徑,旨在為開源世界構建完整的生態系統。」
- 系統級競爭 已超越了原始的基準測試競賽。成功衡量標準為:
- 每次查詢的部署成本 (USD/1M tokens)。
- 微調變體的上市時間 (天 vs. 週)。
- 硬體無關的可移植性 (單一倉庫可在 Ascend, Cambricon 和 NVIDIA 上運行)。
- 開源作為戰略資產: 透過不僅發布權重,還發布整個堆棧 (數據集、訓練腳本、推理引擎),企業創造了吸引開發者、初創公司和學術界的網絡效應。
- 未來展望 (2026+):
- 混合 MoE-量化模型,可針對每個專家動態切換精度。
- 以邊緣為中心的代理,在低功耗 ASIC 上運行以實現即時決策。
- 跨模態蒸餾流水線,將多模態教師壓縮成統一的小模型。
給研究人員、開發者和政策制定者的啟示
- 專注於系統設計 – 在為開源 AI 做貢獻時,優先考慮可重現的流水線、感知硬體的量化和服務腳本。
- 利用小模型 – 它們主導著現實世界的部署;從大型 MoE 教師進行蒸餾是實現高品質的成熟路徑。
- 關注授權 – Apache 2.0 和 MIT 將仍是商業整合最安全的選擇。
- 監控硬體政策 – 出口管制的變化將繼續重塑大規模訓練發生的地點和方式。
- 跨模態協作 – 多模態開源項目正在融合;跨模態數據集和評估套件正在成為社群標準。
DeepSeek 時刻引發了中國 AI 生態系統的重新架構:從孤立的單體模型,轉向一個平衡能力、成本和戰略獨立性的分層、硬體優先的開源堆棧。