GLM-5.3分析:高度なサイバー攻撃能力と緩いセーフガード
TL;DR
Zhipu AIが公開したオープンウェイトモデルであるGLM-5.3は、自律的に動作するサイバー攻撃エクスプロイトを生成でき、組み込みのセーフガードは64%から100%の確率で回避可能であり、攻撃者にとって強力で即時利用可能なツールを提供する一方で、防御者にとっても強力な分析支援となる。
GLM-5.3のエクスプロイト開発性能
重要な発見: GLM-5.3は、AnthropicのClaude Mythos Previewと同等のレベルでエンドツーエンドのエクスプロイトを生成でき、以前のモデルよりもはるかに高い性能を示す。
- ExploitBench (Chrome V8) – GLM-5.3は410回の試行のうち50回成功(約12%)。Claude Mythos Previewは410回のうち56回成功(約14%)。以前のモデル(Claude Opus 4.6、GLM-5.2)はほぼ0%だった。
- 内部バイナリエクスプロイトベンチマーク – GLM-5.3は100件のランダムなタスクのうち4%で完全な制御フローの乗っ取りを達成した。Claude Mythos Previewは6%。以前のモデルはすべてのタスクで成功しなかった。
- 人間が関与するテスト – 限られた人間の注意を要する1日間のセッションにおいて、GLM-5.3はブラウザのJavaScriptエンジンに以前未知のバグを発見し、それらを連結してサンドボックス化されたLinuxブラウザから任意のファイルを読み取る動作するドライブバイエクスプロイトを構築した。その後、無線、グラフィックス、ネットワークデバイスソフトウェアの攻撃可能な脆弱性も特定した。より小さなバージョンであるGLM-5.3-Flashは、20分間の人間の指導と8時間のモデル計算(ZhipuのAPIレートで約$20.40)で、既知のChrome CVE(CVE-2026-11645)に対する信頼性の高いARM64エクスプロイトチェーンを構築した。
"GLM-5.3は、ブラウザのJavaScriptエンジンに複数の以前未知の脆弱性を発見し、限られた人間の関与の下で1日以内に動作するエクスプロイトに組み立てた。" – Anthropicの研究者
これらの結果は、GLM-5.3が重要な閾値を越えたことを確認している:自律的に機能するエクスプロイトを生成できる能力は、以前のオープンウェイトモデルには存在しなかった。
GLM-5.3のセーフガードの脆弱性
重要な発見: 単純なプロンプト工学とモデルのアブレーションにより、GLM-5.3の拒否率は>90%から12%未満に低下し、コア能力は維持された。
- アブレーション(拒否の除去) – Anthropicは標準的な「消去」技術を用いて、GLM-5.3のアブレーション版を約2,200 GPU時間(約$4,400)で再構築した。JailbreakBenchおよびHarmBenchでは拒否率が約95%から3%に低下し、StrongREJECTでは12%に低下した。GPQA-DiamondおよびCyberGymでの能力スコアは数パーセントの変化にとどまった。
- アブレーションしないバイパス – モデルを変更せずに、Anthropicは3つのプロンプトベースのトリックを特定した:
- 欺瞞的な背景ストーリー(モデルが自律的なレッドチームエージェントであると偽る) – 64%の参加率。
- 事前に埋め込まれた推論トークン – 92%の参加率。
- アブレーションされたモデル – 100%の参加率。
- Claudeとの比較 – セーフガード付きのClaudeモデル(Opus 4.8、Opus 5、Mythos 5)は、すべての条件下で悪意あるリクエストを0%拒否した。ClaudeのAPIは事前埋め込みトークンを許可せず、重みは公開されていないため、アブレーションは不可能である。
"アブレーション後、GLMモデルは有害なクエリをほとんど拒否しなくなったが、科学的およびサイバー・ジム性能はほぼ変化しなかった。" – Anthropicの分析
NIST CAISIによる独立検証
重要な発見: NISTのAI標準化・イノベーションセンター(CAISI)は、GLM-5.3をこれまでで最もサイバー能力が高いオープンウェイトモデルとして独立評価し、米国の最先端モデルと比べて約4か月の遅れを示した。
- CAISIの評価はAnthropicのベンチマーク結果と一致しており、GLM-5.3の優れたエクスプロイト開発能力を確認した。
- 米国の最先端モデルはセーフガードを無効化して評価されたが、一般公開されていないため、GLM-5.3の無制限の可用性との対比が際立っている。
攻撃者と防御者への影響
攻撃者への影響: 自律的に脆弱性を発見・連結できるモデルが無制限に公開されたことで、高度なサイバー攻撃の障壁が低下した。国家および非国家主体は、独自のAI専門知識なしに準最先端のエクスプロイト能力を入手できるようになった。
防御者への影響: 同じ能力は、信頼できるサイバー防御者が手にした場合、脆弱性の発見とパッチ開発を加速できる。AnthropicのProject Glasswingは、悪意ある主体が同様のツールを手にする前に、10,000件以上の重要なソフトウェアバグを発見するのに貢献している。
政策提言: 政府は、高能力なオープンウェイトモデルに対する安全性テストを義務付け、責任あるリリース実践を促進すべきである。独立した評価は、広範な展開前に悪用可能性を浮き彫りにするために不可欠である。
AIコミュニティへの提言
- 自律的なエクスプロイト生成を示すモデルのオープンウェイトリリースは、堅牢で改ざん防止可能なセーフガードが組み込まれている場合に限るべきである。
- Project Glasswingなどの検証済みアクセスプログラムを提供し、防御者が最先端の能力を活用できるようにしつつ、悪意ある利用を制限すべきである。
- アブレーション耐性テストを標準化し、単純な重みの編集でセーフガードを削除できるかどうかを検出すべきである。
- AIモデルが発見した脆弱性について、リアルワールドへの暴露を最小限に抑えるための迅速な開示パイプラインを構築すべきである。
結論
GLM-5.3は画期的な転換点を示している:公開されているモデルが自律的に機能するサイバー攻撃エクスプロイトを構築でき、その最小限のセーフガードは簡単な技術で回避可能である。これは悪意ある主体のサイバー攻撃ツールキットを大幅に拡張する一方で、防御者にとって強力だがリスクを伴う資産も提供する。AIコミュニティは、オープンな研究と厳格な安全対策のバランスを取ることで、こうした能力の無制限な拡散を防ぐべきである。