Gemini 4 Argon 前沿模型公告
TL;DR
Gemini 4 Argon 是 Google DeepMind 的最新前沿模型,提供 1 M token 的上下文視窗,並在軟體工程、企業知識工作與防禦性網路安全領域達到業界領先的表現;該模型最初將透過 Fairwind 計畫提供給值得信賴的網路防禦者使用。
介紹 Gemini 4 Argon
Gemini 4 Argon 被定位為一款「前沿」模型,旨在支援長時間、複雜工作流程中的深度推理。公告強調了三個目標領域:
- 實際的軟體工程
- 企業知識工作,例如法律與金融
- 網路安全防禦
該模型將分階段釋出,初期先提供給受信任的防禦者群體,同時 DeepMind 正與美國政府合作進行自願性預釋出流程,並持續迭代安全防護機制。
定價
- 輸入 token:每百萬個 2 美元
- 輸出 token:每百萬個 10 美元
- 快取輸入 token:輸入價格享有 95 % 折扣
對 Google 內部工作流程的影響
Argon 已經整合至 Google 內部流程,數千名員工報告在專門程式碼撰寫、研究深度與寫作品質方面均有顯著提升。突出的應用案例包括:
- 量子演算法優化 – 在數分鐘內,將時空資源(qubits × gate)減少 40 %,優於已發表的基準。
- 記憶體效率 – 對全體艦隊的遙測資料分析,釋放超過 300 TiB 的記憶體,預計總共可節省 500 TiB – 1 PiB。
- 大規模程式碼遷移 – Argon 代理正在將 C/C++ 程式碼庫轉換為 Rust,從數萬行(例如
re2、libgav1)擴展至超過 800 K 行,用於 Fuchsia OS 的 Zircon 核心。針對libgav1,Argon 以安全的 Rust 替代了 32 K 行 SIMD 程式碼,在保持視訊輸出不變的情況下,實現比先前 Rust 版本快 2.7 倍的效能。
將上下文長度擴展至 1 M token
為處理更長、更複雜的任務,Argon 的最大輸出長度已從 64 K 提升至 1 百萬 token,為業界領先數值。此擴展的上下文使模型能在單一回合中生成長串推理鏈,提升以往需多次互動才能完成任務的表現。
企業級程式碼與知識工作表現
Argon 的多模態推理與長上下文能力,使其在多個基準測試套件中表現卓越:
- DeepSWE v1.1 – 77.9 % 准確率,創下長時程軟體工程任務的新業界領先紀錄。
- Vals Index – 在綜合經濟影響基準中領先,該基準根據美國 GDP 貢獻權重評估金融、程式碼、法律與稅務工作。
- Vals Finance Agent v2 – 在多步驟金融研究中表現最佳。
- Harvey’s Legal Agent Benchmark – 在法律研究與撰寫中獲得最高分。
- AutomationBench (Zapier) – 在端到端企業流程自動化測試中排名第一,得分 51.3 %。
- LVBench – 在長影片理解方面達成業界領先,得分 91.7 %。
這些成果展現了 Argon 在文字密集、多模態與多步驟企業工作流程中的多功能性。
防禦性網路安全能力
Argon 已針對網路安全防禦進行微調,並以「無特定網路安全防護機制」的方式釋出給受信任的防禦者,以展現其完整能力。顯著成就包括:
- 漏洞發現 – 在 Google 內部基準中,Argon 在 20 種程式語言的程式碼庫中識別出廣泛的暴露風險。
- Wiz Scan‑for‑Good 合作 – Argon 發現全球醫療軟體中的一個關鍵漏洞,導致個人資料外洩,此風險先前的前沿模型未能察覺。
- CWE‑bench v1 – 與 68 % 的修復得分並列第一,超越 3.8 Flash Cyber 模型在 CWE‑bench v0 上的表現。
- Wiz 內部滲透測試 – 在攻擊面繪製、漏洞識別與概念驗證生成方面,表現優於 3.8 Flash Cyber。
強化前沿安全防護
在全面釋出前,DeepMind 正加強四類安全防護:
- 濫用預防 – Argon 拒絕協助進行網路、化學、生物、輻射或核攻擊的請求,同時允許合法的雙用途研究。強韌性測試包含內部與外部紅隊演練,以及內部激活監控(詳見 arXiv:2601.11516)。
- 提示注入韌性 – Argon 在 Gray Swan 間接提示注入基準中表現領先,透過自動化紅隊演練與對抗訓練實現。
- 對齊監控 – 透過思考鏈與行為監控,當模型偏離使用者意圖時立即停止執行;警報會轉送至專責事件回應團隊。
- 系統加固 – 在高風險訓練或評估前,沙盒環境會被隔離並封閉,遵循 DeepMind 的代理控制路線圖。
DeepMind 呼籲整個 AI 社群採用推理透明性實務,以確保對齊工作期間模型思維可被觀察。
釋出時程
Gemini 4 Argon 將首先提供給 Fairwind 計畫的受信任網路防禦者群體。後續階段將擴展至開發者、企業與一般消費者,從付費 API 客戶與 Google AI Ultra 會員開始。
意義
- 生產力提升 – 1 M token 的上下文與先進推理能力,使開發者與知識工作者能處理過去需大量人力或多次模型呼叫才能完成的任務。
- 安全影響 – 透過自動化漏洞發現與修補生成,Argon 可加速整個軟體供應鏈的修復週期。
- 安全考量 – 分階段釋出與廣泛的安全防護開發,展現 DeepMind 對前沿能力負責任部署的承諾。
參考資料
- Fairwind 計畫 – https://deepmind.google/fairwind-program/
- 前沿安全框架 – https://deepmind.google/blog/strengthening-our-frontier-safety-framework/
- 代理控制路線圖 – https://deepmind.google/blog/securing-the-future-of-ai-agents/
- Gray Swan IPI 基準 – https://grayswan.io/benchmark/ipi
- CWE‑bench – https://cwe-bench.com/
- Vals Index – https://www.vals.ai/benchmarks/vals_index
- DeepSWE v1.1 – https://github.com/deepswe/evaluation
本文基於 DeepMind 官方部落格文章「Gemini 4 Argon:我們下一個前沿智能時代」,於 2026 年 9 月 30 日發布。