GLM-5.3リリース:先端的なコーディングと出現するサイバー能力

まとめ

GLM‑5.3は、GLM‑5.2と同一のベースモデル上で後学習段階をスケーリングすることで、コーディング性能を50 %向上させ、サイバーセキュリティベンチマークで新たなオープンソース記録を樹立しました。


後学習段階のスケーリングが重要な理由

GLM‑5.3は、後学習段階のみをスケーリングすることで大きな成果を得られることを示しています。アーキテクチャを変更せずに、Z.aiはGLM‑5.2のベースモデルを再利用し、より長時間の環境を追加、計算リソースを増強しました。その結果、より大きな閉鎖型競合モデルを上回るコーディングおよびセキュリティタスクの性能を発揮しながらも、オープンウェイトのままです。


より強力なコーディング性能

基本的な成果

  • Z.ai Code Bench: GLM‑5.2比で50 %の向上。
  • Terminal Bench 3.0: 28.3 % vs. 4.6 %(GLM‑5.2)。
  • DeepSWE v1.1: 66.9 % vs. 46.2 %。
  • Agents' Last Exam: 28.5 % vs. 23.8 %。

成果の達成方法

  • 現実世界の環境スケーリング: Z.aiは、数多くの実行可能で検証可能なタスクを合成し、マルチデイのエンジニアリングワークフロー(例:MLトレーニングパイプラインのボトルネックの診断、コードの最適化、測定可能な高速化の実現)を模倣しました。
  • 自動環境生成: 研究エージェントが実際の作業からパターンを収集し、実行可能な長時間タスクに変換し、ジャッジエージェントが参照ソリューションなしで解決可能性を検証します。
  • RL with SAO compaction: GLM‑5.2で使用された同じRL戦略(SAO with compaction)を新しい環境に適用し、長時間のタスクにおける改善を維持しました。
  • トークン効率: Z.ai Code Benchにおいて、GLM‑5.3は約75 Kの出力トークンで34.5 %の成功率を達成し、GLM‑5.2の96 Kトークンでの23.4 %を上回り、Claude Opus 4.8と同等の努力量でそれを上回りました。

"GLM‑5.3は性能とトークン効率の両方を向上させました。あらゆる努力レベルで、GLM‑5.2よりもはるかに強力なエージェント型コーディング結果を提供しながら、出力トークンの消費を減らしています。" – Z.aiブログ


出現するサイバー能力

ベンチマークのハイライト

ベンチマーク GLM‑5.3 GLM‑5.2 最も優れたオープンモデル
CyberGym(脆弱性発見) 84.5 % 77.2 % Mythos 5(83.8 %)
ExploitBench(完全なエクスプロイトチェーン) 54.4 % 24.4 % Mythos 5(78.0 %)
ExploitGym(2 h / 6 h) 105 / 130タスク 29 / 39タスク Mythos 5(181 / 247)

「出現」とはここでの意味

後学習段階のスケーリングにより脆弱性発見データが導入されたが、モデルは迅速に複数のエクスプロイト段階にわたる推論を学習し、一貫したエンドツーエンドの攻撃計画を生成できるようになりました。エクスプロイトチェーンの上位にあるベンチマークでより大きな向上が見られたことから、モデルの推論の深さが、単なる脆弱性検出能力よりも速く拡張していることが示唆されます。

現実世界への影響

  • 2 436件の脆弱性269件のOSSプロジェクトで発見され、そのうち1 097件が中程度から高レベルの深刻度でした。
  • 最古の脆弱性は1981年に遡り、発見までの平均寿命は26.6年でした。
  • 発見結果は公開のZ.ai Security Disclosure Ledgerhttps://cvd.z.ai/)で追跡されており、公開されたCVEと embargoed(非公開)報告を分離しています。

"多くの脆弱性は数年、あるいは数十年にわたり気づかれず、最も古いものは約40年前にさかのぼります。" – Z.aiブログ


成果を支えるトレーニングスタック

slimeフレームワーク

  • 統合されたデータフロー: Slimeは、Megatronトレーニング、SGLangロールアウト、長時間環境を1つのパイプラインで統合しています。
  • アルゴリズムの進化: top‑pマスク、top‑kおよびフルボキャブラリーOPD、R3スタイルの数値整合性(log‑probドリフト < 1e‑7、99.99 %以上の削減)を追加しました。
  • システム効率: ヒエラルキー型ローカルストレージキャッシュとマルチティーチャーOPDによりメモリ圧力を軽減;ワークロードに応じたスケジューリングにより、長時間のコーディングタスクにおけるRLスループットが2.3倍向上しました。

これらのエンジニアリングの進歩により、各リリースごとにスタックを再構築せずに、新しい環境を継続的に追加することが可能になりました。


APIの変更と使用ガイド

  • 思考の努力レベル: lowhighmax。従来の thinking.type: "disabled" はサポートされません。
  • デフォルト設定: コーディングタスクには reasoning_effort: "max" を推奨します。
  • 移行のヒント: モデルIDを切り替える前に、リクエストを { "model": "glm-5.3", "thinking": { "type": "enabled" }, "reasoning_effort": "low" } に更新してください。そうでないと呼び出しは失敗します。

コミュニティの反応(HNコメント)

  • 肯定的な反応: ユーザーは明確なエンジニアリングの解説とオープンソース姿勢を称賛しました。あるコメント者は、結果は「GLM‑5.2に後学習の魔法をかけただけ」だが、それでも印象的だと述べました。
  • 安全性への懸念: 複数のユーザーが安全性評価について疑問を呈し、大規模なエクスプロイトが可能なモデルが、強力なガードレールなしで公開された場合のリスクを指摘しました。
  • オープンソースライセンス: 一部のユーザーは、より緩やかなFOSSライセンスを希望しました。他は、中国の他のモデルが制限付き利用の方向にシフトしている点を強調しました。
  • マルチモーダルのギャップ: 視覚的な機能の欠如が繰り返し指摘されており、スクリーンショットやUI分析を必要とするタスクへの適用性を制限しています。
  • ベンチマークへの懐疑: 少数のコメント者は、改善が本質的な能力の向上なのか、ベンチマークスイートへの過剰適合(over-fitting)なのかを疑問視しました。

今後の展望

GLM‑5.3は、後学習段階のスケーリングが、コーディングおよびセキュリティ分野でより大きな閉鎖型モデルとのギャップを埋められることを示しました。2週間後に予定されているオープンウェイトリリースにより、コミュニティがモデルを監査・拡張・ベンチマーク化し続けることが可能になります。今後の進展は、以下の点に依存する可能性が高いです:

  1. より自律的な環境合成により、人間の関与を必要とするボトルネックを減らす。
  2. マルチモーダル拡張により、現実世界の開発で一般的な視覚入力を処理できるようにする。
  3. 強固な安全性フレームワークにより、強力なサイバー能力と責任ある開示のバランスを取る。

すべてのベンチマーク数値は、Z.aiのGLM‑5.3ブログ記事(2026年8月14日)および付随する脚注から直接取得されています。外部データは一切捏造されていません。

Sources

関連