開源 AI 與開放權重模型的現狀 (2026)

2026 年的人工智能領域,其特徵在於專有「封閉」模型與「開放權重」模型之間的差距正在縮小。雖然封閉模型仍掌握著絕對的性能前沿,但以中國實驗室為主導的開放權重模型已進入持續追趕的狀態,通常僅落後前沿技術 4 到 6 個月。

開放與封閉的性能差距

開放權重模型現在運行在帕累托成本前沿上,以專有系統極小部分的成本提供高智能水平。雖然它們可能無法定義能力的絕對天花板,但對於大多數企業級代理工作流(agentic workflows)而言,它們已變得日益充足。

  • 性能差異: 来自 SemiAnalysis 和其他研究人員的獨立評估表明,領先的開放與封閉模型之間的差距已縮小至約 4-6 個月。
  • 成本效率: 如 DeepSeek V4 Flash 等模型證明了開放權重模型可以實現高智能分數(例如,Artificial Analysis Intelligence Index 中的 50 分),同時在部署成本上顯著低於封閉的替代方案。
  • 採用趨勢: 西方公司正日益從封閉實驗室轉向中國的開放權重模型以降低開銷。值得注意的例子包括 Perplexity 採用 DeepSeek R1,以及 Thomson Reuters 基於 Qwen 進行開發以減少對 Claude 的依賴。

中國開放權重模型的霸權地位

自 2024 年以來,領先的開放權重模型主要源自中國實驗室,這些實驗室利用了開源開發的結構性優勢和激進的發布週期。

  • 戰略敏捷性: 中國實驗室通常採用「快速推出」的策略,在完成後的幾小時內就將模型開源,以獲取生態系統的關注度。
  • 技術里程碑: 如 GLM-5.2 和 GLM-5.3 等模型已被視為開放代理(open agents)的階段性變革,使中國實驗室能夠與美國的前沿研究保持同步。
  • 監管摩擦: 西方公司使用中國模型引發了美國的監管審查。立法者已針對包括 DoorDash、Airbnb、Anysphere (Cursor) 和 Apple 在內的企業,就其整合中國 AI 模型的情況進行了調查。

蒸餾與合成數據的角色

蒸餾(Distillation)——即使用較大、更強大的模型的輸出 token 來訓練較小模型的過程——是 2026 年的核心技術爭論點。它是加速開放與封閉模型趨合的關鍵機制。

  • 推理鏈提取: 最近的研究(Panfilov et al., 2026)顯示,可以操縱前沿實驗室的 API 來提取系統性的推理痕跡(reasoning traces),這對於訓練現代推理模型至關重要。Anthropic 已確認中國實驗室使用了這些技術進行非法蒸餾。
  • 創新 vs. 蒸餾: 雖然批評者認為蒸餾是中國模型成功的唯一原因,但證據表明它與真正的創新相輔相成。蒸餾被用於在跨代理行為的強化學習(RL)環境中提升模型,而非僅僅是複製權重。
  • 數據公地危機: 真正的開源 AI 研究正受到 AI 數據公地快速衰退的阻礙。隨著高質量公共數據的消失,實驗室越來越依賴合成數據和對剩餘網絡內容的激進採集。

安全、政策與「開放權重」的區別

「開源」與「開放權重」之間存在關鍵區別。許多行業專家認為,大多數「開放」模型實際上是開放權重——僅提供模型權重的二進制塊,而沒有提供實現真正開源可重複性所需的完整訓練數據、配方或策劃過程。

安全權衡

  • 邊際風險: 研究表明,文本型 LLM 僅會略微增加已記錄的潛在風險。一些人認為,開放權重模型的假設性風險被封閉模型的現實風險所掩蓋,因為封閉模型的護欄(guardrails)經常被繞過。
  • 非擴散限制: 專家建議,禁止開放權重模型是無效的,因為惡意行為者將始終保有獲取智能的途徑。重點正在轉向讓社會為下游風險做好準備,而非試圖阻擋模型訪問權限。

監管展望

  • 「氛圍監管」風險: 人們日益擔心美國聯邦政府模糊的監管機制可能導致對前沿開放權重模型的衝突或禁令,這可能在國際競爭面前扼殺美國的研發與創新。

社群觀點與批判

開發者社群內的技術討論凸顯了政策層面的論述與技術現實之間的鴻溝。一些從業者認為,對「對齊」和「安全」的關注往往掩蓋了技術的基本機制。

"對於 AI 的論述水平已大幅下降... 如果在 AI 革命進行了 5 年後,人們還在疑惑為什麼數據集沒有被發布。它們沒有被發布是因為它們就是互聯網的該死的該死的快照... 用你的腦袋思考一下吧。"

此外,社群強調閱讀技術報告(例如 DeepSeek R2 關於使用 RL 來引導 chain-of-thought tokens 的論文)的重要性,而非僅僅閱讀高層級的政策摘要,以真正理解技術的前沿狀態。

Sources