Gemini 4 Argon:Google 的程式碼、企業工作流程與資安前沿模型

Gemini 4 Argon – 它是什麼,以及為什麼重要

Google 發布了 Gemini 4 Argon,作為其最新的前沿級大型語言模型。該模型支援最多 1 百萬輸出 token,遠超先前的 64 K 限制,目前已在內部用於高影響力任務,例如量子演算法優化、大型程式碼庫遷移,以及自主漏洞發現。透過 Fairwind 計畫的早期釋出,目標對象為值得信賴的資安防禦者,初期商業定價為 2 美元 / 百萬輸入 token(輸出 token 為 10 美元 / 百萬)。這些能力標誌著 AI 增強的軟體工程、企業知識工作與大規模防禦性資安的轉變。


Google 內部的影響

Argon 加速了前沿研究與運營。

  • 量子演算法優化: Argon 在數分鐘內將一個瓶頸子例行程式所需的時空資源(量子位元 × 閘)降低了 40 %,表現優於已發表的基線。
  • 記憶體效率: 自主分析整個叢集的遙測資料,釋放了 >300 TiB 的記憶體,預計全面部署後可節省 500 TiB – 1 PiB。
  • 大規模 C/C++ 至 Rust 迁移: Argon 機器人已遷移數萬行核心函式庫程式碼(例如 re2、libgav1),以及 800 K+ 行 的 Fuchsia OS Zircon 核心。對於 libgav1,由 Argon 生成的 Rust 版本比先前的 Rust 版本快 2.7×,同時保持記憶體安全。

「Argon 機器人正在 Google 內部將 C/C++ 程式碼庫遷移至 Rust——從核心函式庫如 re2、libgav1 的數萬行,擴展至 Fuchsia OS Zircon 核心的 800K+ 行。」 – Google blog


Token 窗口擴展實現深度推理

Argon 的 1 百萬 token 輸出限制(由 64 K 提升)讓模型有足夠空間生成長且連續的推理鏈。這對於需要保留中間思考、工具呼叫與驗證步驟的複雜多步驟問題至關重要。更大的視窗減少頻繁提示截斷的需求,使單一推理路徑即可解決原本需多個 API 呼叫才能完成的任務。


各領域的基準領先表現

程式碼與軟體工程

  • DeepSWE v1.1: Argon 獲得 77.9 %,在長遠程軟體工程任務上創下新紀錄。

企業知識工作

  • Vals Index: Argon 在綜合經濟影響基準中領先,該基準根據美國 GDP 貢獻權重評估金融、程式碼、法律與稅務工作負載。
  • Vals Finance Agent v2 與 Harvey’s Legal Agent Benchmark: Argon 取得頂尖分數,展現多步驟金融研究與法律撰寫能力。
  • AutomationBench (Zapier): Argon 在端到端企業功能自動化任務中排名第一,得分 51.3。

多模態理解

  • LVBench (長影片理解): Argon 獲得 91.7 分,為目前的最優表現。

資安防禦作為首選能力

Argon 特意訓練用於防禦性安全任務,並在釋出時 不設置特定於網路攻擊的防護機制,以便值得信賴的防禦者能充分發揮其全部潛力。

  • 漏洞發現: 在 Google 內部基準測試中,Argon 在 20 種程式語言 中識別出關鍵暴露。
  • Wiz Scan for Good: Argon 發現全球醫療軟體中一個嚴重的資料外洩漏洞,此漏洞先前的前沿模型未能察覺。
  • CWE‑bench v1: Argon 與 68 % 的修復分數並列 第一名,超越先前的 Flash Cyber 模型。

「Argon 可自主發現、驗證並修復關鍵軟體漏洞。」 – Google blog


安全與對齊保障措施

在廣泛釋出前,Google 正加強四類保障機制:

  1. 濫用預防: 拒絕機制可阻擋與 CBRN 相關的請求,同時允許合法的雙用途研究,並透過內部激活監控機制偵測濫用行為。
  2. 提示注入韌性: Argon 在 Gray Swan 間接提示注入 (IPI) 基準上表現出領先的韌性。
  3. 對齊監控: 透過思考鏈追蹤,當模型偏離使用者意圖時會中止執行;相關發現 不會 反饋至訓練過程,以避免惡意適應。
  4. 系統加固: 在高風險訓練或評估前,封閉沙盒環境,遵循 Agent Control Roadmap。

「我們強烈建議業界其他成員維持推理透明度……以確保模型的思考仍有助於識別與診斷對齊問題。」 – Google blog


定價與可用性

  • 初期定價: 2 美元 / 百萬輸入 token,10 美元 / 百萬輸出 token;快取的輸入 token 可享 95 % 折扣。
  • 後期定價: 4 美元 / 百萬輸入與 20 美元 / 百萬輸出(如社群留言所提及)。
  • 推出計畫: 初期透過 Fairwind 計畫 提供值得信賴的資安防禦者存取,隨後逐步擴展至開發者、企業,最終開放給一般消費者。

Hacker News 社群反應

  • 正面驚喜: 使用者報告 Argon 可自動為 ROCm 生成 GPU 驅動程式修補,此任務過去需手動除錯。 (taylorfinley)
  • 對基準的懷疑: 多位評論者質疑報告分數的相關性,指出可能存在「基準最大化」現象,且模型未公開。 (pietz, small_model)
  • 定價擔憂: 有人認為 Argon 的成本與 OpenAI 的 Opus 相當,且因 Google 快取效率不佳,可能缺乏競爭力。 (GodelNumbering)
  • 戰略意涵: 觀察者指出,該模型在內部用於大規模 C++ 至 Rust 迁移,顯示 Google 已深度整合 LLM 至核心工程流程。 (wg0, uvdn7)
  • 可用性挫折: 使用者表達失望,認為模型雖為「前沿」釋出,卻尚未對一般 API 客戶開放。 (Revanche1367, deanc)

未來展望

Gemini 4 Argon 展示了 Google 現在能提供前沿級推理、巨大上下文視窗,以及在特定領域表現媲美甚至超越競爭模型的能力。其分階段、以安全為先的推出策略,反映了業界對負責任部署的日益重視。若內部生產力提升(如程式碼遷移、記憶體節省、量子優化)能轉化為外部客戶價值,Argon 可能成為企業追求 AI 增強工程與安全的關鍵工具。


所有事實與引述均直接來自 Google 的公告部落格與 Hacker News 上得分最高的評論。

Sources

相關