Gemini 4 Argon:Google 的前沿编码、企业工作流与网络安全模型

Gemini 4 Argon – 它是什麼以及為什麼重要

Google 宣布推出 Gemini 4 Argon,作为其最新的前沿级大语言模型。该模型支持高达 1 百万输出标记,远超此前的 64 K 限制,目前已在内部用于高影响力任务,如量子算法优化、大规模代码库迁移以及自主漏洞发现。通过 Fairwind 计划的早期发布,面向受信任的网络安全防御者,初期商业定价为 2 美元 / 百万输入标记(输出标记为 10 美元 / 百万)。这些能力标志着人工智能增强的软件工程、企业知识工作以及大规模防御性网络安全的转变。


Google 内部影响

Argon 加速前沿研究与运营。

  • 量子算法优化: Argon 在几分钟内将一个瓶颈子例程的时空资源(量子比特 × 门)减少了 40 %,表现优于已发表的基线。
  • 内存效率: 自主分析全网遥测数据释放了 >300 TiB 内存,预计全面部署后可节省 500 TiB – 1 PiB。
  • 大规模 C/C++ 到 Rust 的迁移: Argon 代理已迁移核心库(如 re2、libgav1)中的数万行代码,以及 Fuchsia OS Zircon 内核的 800 K+ 行代码。对于 libgav1,Argon 生成的 Rust 版本比之前的 Rust 版本快 2.7 倍,同时保持内存安全。

“Argon 代理正在 Google 内部迁移 C/C++ 代码库至 Rust——从核心库中数万行(如 re2、libgav1)扩展到 Fuchsia OS Zircon 内核的 800K+ 行。” – Google 博客


标记窗口扩展支持深度推理

Argon 的 1 百万标记输出限制(从 64 K 提升)为模型提供了生成长串、不间断推理链的空间。这对于需要在上下文中保留中间思考、工具调用和验证步骤的复杂多步骤问题至关重要。更大的窗口减少了频繁提示截断的需求,使单个推理轨迹即可解决过去需要多次 API 调用才能完成的任务。


多领域基准领先

编码与软件工程

  • DeepSWE v1.1: Argon 得分为 77.9 %,在长周期软件工程任务上创下新纪录。

企业知识工作

  • Vals Index: Argon 在综合经济影响基准中领先,该基准根据美国 GDP 贡献权重对金融、编码、法律和税务工作负载进行加权。
  • Vals Finance Agent v2 和 Harvey’s Legal Agent Benchmark: Argon 取得最高分,展示了多步骤金融研究和法律起草能力。
  • AutomationBench (Zapier): Argon 在端到端业务功能自动化任务中排名第一,得分为 51.3。

多模态理解

  • LVBench (长视频理解): Argon 得分为 91.7,目前处于行业领先水平。

网络安全防御作为首要能力

Argon 专为防御性安全任务进行训练,并向受信任的防御者发布时 不设网络安全特定的防护机制,以便他们充分发挥其全部潜力。

  • 漏洞发现: 在 Google 内部基准测试中,Argon 在 20 种编程语言中识别出关键暴露。
  • Wiz Scan for Good: Argon 发现了全球医疗软件中一个严重的数据泄露漏洞,此前的前沿模型未能察觉。
  • CWE‑bench v1: Argon 以 68 % 的修复得分与第一名并列,优于此前的 Flash Cyber 模型。

“Argon 可以自主发现、验证并修补关键软件漏洞。” – Google 博客


安全与对齐保障措施

在广泛发布前,Google 正强化四大保障类别:

  1. 滥用预防: 拒绝机制可阻止与 CBRN 相关的请求,同时允许合法的双重用途研究,内部激活监控机制用于检测滥用行为。
  2. 提示注入鲁棒性: Argon 在 Gray Swan 间接提示注入 (IPI) 基准测试中表现出领先的抗干扰能力。
  3. 对齐监控: 思维链追踪机制在模型偏离用户意图时会中止执行;相关发现 不会 反馈至训练过程,以避免对抗性适应。
  4. 系统加固: 在高风险训练或评估前,沙箱环境将被密封,遵循 Agent Control Roadmap。

“我们强烈建议整个行业保持推理透明度……以确保模型的思考有助于识别和诊断对齐问题。” – Google 博客


定价与可用性

  • 初期价格: 2 美元 / 百万输入标记,10 美元 / 百万输出标记;缓存输入标记享有 95 % 折扣。
  • 初期后价格: 4 美元 / 百万输入标记,20 美元 / 百万输出标记(如社区评论所述)。
  • 发布计划: 初期通过 Fairwind 计划 向受信任的网络安全防御者开放,随后逐步扩展至开发者、企业,最终面向消费者开放。

Hacker News 社区反应

  • 积极惊喜: 用户报告 Argon 能自动为 ROCm 生成 GPU 驱动补丁,此前该任务需手动调试。 (taylorfinley)
  • 对基准的怀疑: 多位评论者质疑报告得分的相关性,指出可能存在“基准优化”现象,且模型未公开。 (pietz, small_model)
  • 定价担忧: 部分人认为 Argon 的成本与 OpenAI 的 Opus 相当,考虑到 Google 的缓存效率低下,可能缺乏竞争力。 (GodelNumbering)
  • 战略意义: 观察者指出,该模型在内部用于大规模 C++ 到 Rust 的迁移,表明 Google 已深度整合 LLM 至核心工程流程。 (wg0, uvdn7)
  • 可用性沮丧: 用户表达失望,尽管是“前沿”发布,但普通 API 客户仍无法访问。 (Revanche1367, deanc)

展望

Gemini 4 Argon 展示了 Google 现在能够提供前沿级推理能力、超大上下文窗口以及在特定领域表现媲美甚至超越竞争模型的性能。其分阶段、以安全为先的发布策略反映了行业对负责任部署日益增长的重视。如果内部生产率提升(如代码迁移、内存节省、量子优化)能转化为外部客户价值,Argon 有望成为企业寻求人工智能增强工程与安全的关键工具。


所有事实与引述均直接来自 Google 的公告博客及 Hacker News 上得分最高的评论。

Sources

相关