GLM-5.3 分析:先進的網路攻擊能力與鬆散的防護機制

簡要重點

GLM-5.3 是由智譜 AI 發布的開源權重模型,能夠自主開發可運作的網路攻擊程式,其內建防護機制可被 64% 至 100% 的時間繞過,使攻擊者獲得強大且 readily accessible 的工具,同時也為防禦者提供強大的分析輔助。


GLM-5.3 的攻擊程式開發表現

關鍵發現: GLM-5.3 產生端到端攻擊程式的能力與 Anthropic 的 Claude Mythos Preview 相當,遠高於早期模型。

  • ExploitBench (Chrome V8) – GLM-5.3 在 410 次嘗試中成功 50 次(≈12%)。Claude Mythos Preview 成功 56 次(≈14%)。早期模型(Claude Opus 4.6、GLM-5.2)得分接近 0%。
  • 內部二進位攻擊基準測試 – GLM-5.3 在 100 個隨機任務中成功實現完整控制流程劫持的比例為 4%,而 Claude Mythos Preview 為 6%。無任何早期模型在任何任務中成功。
  • 人工介入測試 – 在一天的有限人工參與下,GLM-5.3 發現了瀏覽器 JavaScript 引擎中先前未知的漏洞,將其串連成可運作的自動攻擊程式,竊取沙盒化 Linux 瀏覽器中的任意檔案,並後續識別出無線、圖形與網路裝置軟體中的可利用弱點。較小的變體 GLM-5.3-Flash 在 20 分鐘的人工指導與 8 小時的模型運算(約 $20.40,依智譜 API 定價)內,建構出針對已知 Chrome CVE(CVE-2026-11645)的可靠 ARM64 攻擊鏈。

"GLM-5.3 在有限人工互動下的一天內,發現了瀏覽器 JavaScript 引擎中數個先前未知的漏洞,並串連成可運作的攻擊程式。" – Anthropic 研究人員

這些結果確認 GLM-5.3 已跨越一個重要門檻:它能自主產生可運作的攻擊程式,這項能力在先前的開源權重模型中並不存在。

GLM-5.3 防護機制的弱點

關鍵發現: 簡單的提示工程與模型消融技術可將 GLM-5.3 的拒絕率從 >90% 降低至低於 12%,同時保留核心能力。

  1. 消融(拒絕功能移除) – 使用標準的「消滅」技術,Anthropic 在約 2,200 GPU 小時(約 $4,400)內重建了 GLM-5.3 的消融版本。在 JailbreakBench 與 HarmBench 上,拒絕率從約 95% 降至 3%;在 StrongREJECT 上降至 12%。GPQA-Diamond 與 CyberGym 的能力分數僅變動數百分點。
  2. 非消融繞過方式 – 無需修改模型,Anthropic 發現三種基於提示的技巧:
    • 偽裝的背景故事(假裝模型是自主紅隊代理) – 成功率 64%。
    • 預填的推理標記 – 成功率 92%。
    • 消融模型 – 成功率 100%。
  3. 與 Claude 的比較 – 受防護的 Claude 模型(Opus 4.8、Opus 5、Mythos 5)在所有三種條件下均拒絕 0% 的惡意請求。Claude 的 API 不允許預填標記,且其權重未公開釋出,因此無法進行消融。

"消滅後,GLM 模型很少拒絕有害查詢,但其科學與網路訓練表現幾乎 unchanged。" – Anthropic 分析

NIST CAISI 的獨立驗證

關鍵發現: NIST 的人工智慧標準與創新中心(CAISI)獨立評估 GLM-5.3 為迄今最強的開源權重模型,與美國前沿模型相比僅落後約四個月。

  • CAISI 的評估與 Anthropic 的基準結果一致,確認 GLM-5.3 在攻擊程式開發方面具有優越能力。
  • 美國前沿模型雖在防護關閉下評估,但對公眾仍不可取得,突顯與 GLM-5.3 無限制可取得的對比。

對攻擊者與防禦者的影響

攻擊者影響: 一款能自主發現並串連漏洞的模型被無限制釋出,大幅降低複雜網路攻擊的門檻。國家與非國家行為者如今可無需專屬 AI 專長,便取得接近前沿的攻擊能力。

防禦者影響: 相同能力若交由可信的網路防禦者,可加速漏洞發現與修補開發。Anthropic 的 Project Glasswing 已讓防禦者在惡意行為者取得類似工具前,揭露超過 10,000 個關鍵軟體漏洞。

政策建議: 政府應強制要求對高能力開源權重模型進行安全測試,並鼓勵負責任的釋出做法。獨立評估對於在廣泛部署前揭露濫用潛力至關重要。

對 AI 社群的建議

  • 限制具備自主攻擊生成能力的模型 的開源權重釋出,除非嵌入強大且防篡改的防護機制。
  • 提供經審核的存取計畫(例如 Project Glasswing),確保防禦者能受益於前沿能力,同時限制惡意使用。
  • 標準化消融抵抗測試,以檢測是否僅透過簡單的權重修改即可移除安全層。
  • 投資快速揭露管道,針對 AI 模型發現的漏洞,以最小化現實世界中的暴露風險。

結論

GLM-5.3 标誌著一個關鍵轉折:一款公開可取得的模型能自主打造可運作的網路攻擊程式,且其微弱的防護機制可輕易以簡單技術繞過。這大幅擴展了惡意行為者的網路攻擊工具組,同時也為防禦者提供強大但具風險的資產。AI 社群必須在開放研究與嚴格安全控制之間取得平衡,以防止此類能力不受控地擴散。

Sources