Gemini 4 Argon Frontier Model Announcement
TL;DR
Gemini 4 Argon は Google DeepMind の最新のフロンティアモデルであり、1 Mトークンのコンテキスト窓を備え、ソフトウェア工学、企業知識作業、防御的サイバーセキュリティ分野で最先端のパフォーマンスを発揮しています。当初は Fairwind プログラムを通じて信頼できるサイバー防衛者に限定公開されます。
Gemini 4 Argon の紹介
Gemini 4 Argon は、長期間にわたる複雑なワークフローにわたって深い推論を維持できるように設計された「フロンティア」モデルです。発表では、以下の3つのターゲット分野に焦点を当てています:
- 実世界のソフトウェア工学
- 法務や金融など企業知識作業
- サイバーセキュリティ防御
このモデルは段階的にリリースされ、DeepMind が米国政府の自主的リリース前アクセスプロセスと協議し、安全ガードレールを改善する中で、信頼できる防衛者グループから始めて提供されます。
価格
- 入力トークン: 100万トークンあたり $2
- 出力トークン: 100万トークンあたり $10
- キャッシュされた入力トークン: 入力価格の 95 % オフ
Google 内部ワークフローへの影響
Argon はすでに Google 内部のプロセスに統合されており、数千人の従業員が専門的なコーディング、研究の深さ、執筆の質の向上を報告しています。特に注目される活用事例には以下が含まれます:
- 量子アルゴリズム最適化 – 公開されたベースラインと比較して、数分のうちに spacetime リソース(キュービット × ゲート)を 40 % 減少。
- メモリ効率 – フリート全体のテレメトリ分析により、300 TiB 以上のメモリを解放。総計で 500 TiB – 1 PiB の節約が見込まれます。
- 大規模なコード移行 – Argon エージェントは C/C++ コードベースを Rust に変換しており、
re2やlibgav1の数万行規模から、Fuchsia OS の Zircon カーネルで 800 K 行以上にスケーリングしています。libgav1では、Argon が 32 K 行の SIMD コードを安全な Rust に置き換え、従来の Rust ポートよりも 2.7倍の高速化を達成しながら、動画出力を維持しました。
コンテキスト長を 1 M トークンに拡張
より長く、より複雑なタスクに対応するため、Argon の最大出力長は 64 K から 1 百万トークン に拡張されました。これは業界をリードする数値です。拡張されたコンテキストにより、モデルは一度の処理で長大な推論チェーンを生成でき、これまで複数のやり取りが必要だったタスクのパフォーマンスが向上します。
企業レベルのコーディングおよび知識作業パフォーマンス
Argon のマルチモーダル推論と長コンテキスト能力は、いくつかのベンチマークスイートでトップクラスの結果をもたらしています:
- DeepSWE v1.1 – 77.9 % の精度、長期間のソフトウェア工学タスクにおける新たな最先端記録。
- Vals Index – U.S. GDP 貢献度に基づいて金融、コーディング、法務、税務作業を重み付けた複合的経済的インパクトベンチマークでリード。
- Vals Finance Agent v2 – 複数ステップの金融調査で最高のパフォーマンス。
- Harvey’s Legal Agent Benchmark – 法的調査および文書作成で最高スコア。
- AutomationBench (Zapier) – 51.3 % のスコアで、エンドツーエンドのビジネスプロセス自動化で第1位。
- LVBench – 91.7 % のスコアで、長時間動画理解の最先端記録を達成。
これらの結果は、Argon がテキスト中心、マルチモーダル、複数ステップの企業ワークフローにおいて多様性を発揮できることを示しています。
防御的サイバーセキュリティ機能
Argon はサイバーセキュリティ防御にファインチューニングされており、サイバー特化のガードレールなしで信頼できる防衛者にリリースされ、その全能力を発揮できるようにしています。顕著な成果には以下が含まれます:
- 脆弱性発見 – Google 内部ベンチマークで、20言語のコードベースにわたり広範な暴露を特定。
- Wiz Scan‑for‑Good パートナーシップ – グローバルなヘルスケアソフトウェアに深刻な脆弱性を発見。個人データが暴露されるリスクを、以前のフロンティアモデルが見逃していた。
- CWE‑bench v1 – 68 % の修復スコアで首位と並び、CWE‑bench v0 での 3.8 Flash Cyber モデルのパフォーマンスを上回りました。
- Wiz 内部ペネトレーションテスト – 攻撃表面マッピング、脆弱性特定、PoC 生成のすべてで 3.8 Flash Cyber を上回りました。
フロンティアガードレールの強化
広範なリリースの前に、DeepMind は以下の4つのガードレールカテゴリを強化しています:
- 悪用防止 – サイバー、化学、生物、放射性、核攻撃を助長するリクエストには拒否し、正当な二重利用研究は許可。堅牢性テストには内部および外部のレッドチーム演習、および内部アクティベーションの監視が含まれます(arXiv:2601.11516 参照)。
- プロンプトインジェクション耐性 – Gray Swan Indirect Prompt Injection ベンチマークで業界をリードする堅牢性を示しており、自動レッドチーム演習と敵対的訓練によって達成。
- 不一致モニタリング – 一連の思考と行動の監視により、モデルがユーザーの意図から逸脱した場合に実行を停止。アラートは専任のインシデント対応チームにルーティングされます。
- システムの強化 – 高リスクのトレーニングや評価の前に、サンドボックス環境は隔離・封印されます。DeepMind のエージェント制御ロードマップに従います。
DeepMind は、AIコミュニティ全体が推論の透明性を確保する実践を採用するよう呼びかけています。これにより、アライメント作業中にモデルの思考が観察可能になります。
ロールアウトスケジュール
Gemini 4 Argon は、最初に Fairwind プログラムの信頼できるサイバー防衛者グループに提供されます。その後のフェーズでは、開発者、企業、一般ユーザーにアクセスを拡大し、有料 API カスタマーおよび Google AI Ultra サブスクライバーから始まります。
意義
- 生産性の向上 – 1 Mトークンのコンテキストと高度な推論により、開発者や知識作業者は、かつては膨大な人的努力や複数のモデル呼び出しを必要としていたタスクに取り組めるようになります。
- セキュリティへの影響 – 脆弱性発見とパッチ生成を自動化することで、ソフトウェアサプライチェーン全体の修復サイクルが加速する可能性があります。
- 安全上の配慮 – 段階的なリリースと広範なガードレール開発は、DeepMind がフロンティア能力の責任ある展開にコミットしていることを示しています。
参考文献
- Fairwind プログラム – https://deepmind.google/fairwind-program/
- フロンティアセキュリティフレームワーク – https://deepmind.google/blog/strengthening-our-frontier-safety-framework/
- エージェント制御ロードマップ – https://deepmind.google/blog/securing-the-future-of-ai-agents/
- Gray Swan IPI ベンチマーク – https://grayswan.io/benchmark/ipi
- CWE‑bench – https://cwe-bench.com/
- Vals Index – https://www.vals.ai/benchmarks/vals_index
- DeepSWE v1.1 – https://github.com/deepswe/evaluation
この記事は、2026年9月30日に公開された公式 DeepMind ブログ記事「Gemini 4 Argon: our next era of frontier intelligence」に基づいています。