Gemini 4 Argon 前沿模型发布公告
TL;DR
Gemini 4 Argon 是 Google DeepMind 的最新前沿模型,提供 1 M 标记的上下文窗口,并在软件工程、企业知识工作和防御性网络安全领域达到行业领先性能;它最初通过 Fairwind 计划向可信的网络安全防御者提供。
推出 Gemini 4 Argon
Gemini 4 Argon 被定位为一款“前沿”模型,旨在支持在长周期、复杂工作流中持续进行深度推理。发布强调了三个目标领域:
- 现实世界的软件工程
- 企业知识工作,如法律和金融
- 网络安全防御
该模型将分阶段发布,最初面向可信防御者群体,同时 DeepMind 正与美国政府合作开展自愿的预发布访问流程,并持续优化安全防护机制。
定价
- 输入标记: 每百万标记 2 美元
- 输出标记: 每百万标记 10 美元
- 缓存输入标记: 输入价格享受 95 % 折扣
对 Google 内部工作流程的影响
Argon 已集成到 Google 内部流程中,数千名员工报告在专业编码、研究深度和写作质量方面均有显著提升。突出的应用场景包括:
- 量子算法优化 – 在几分钟内,将时空资源(量子比特 × 门)减少了 40 %,优于已发表的基线。
- 内存效率 – 对全 fleet 的遥测数据进行分析,释放了超过 300 TiB 内存,预计总节省可达 500 TiB – 1 PiB。
- 大规模代码迁移 – Argon 代理正在将 C/C++ 代码库转换为 Rust,从数万行(如
re2、libgav1)扩展到超过 800 K 行,用于 Fuchsia OS Zircon 内核。对于libgav1,Argon 用安全的 Rust 替换了 32 K 行 SIMD 代码,在保持视频输出不变的前提下,相比之前的 Rust 版本实现了 2.7 倍的性能提升。
将上下文长度扩展至 1 M 标记
为应对更长、更复杂的任务,Argon 的最大输出长度已从 64 K 提升至 1 百万标记,这一数字处于行业领先地位。扩展的上下文使模型能够在单次调用中生成长链条的推理,从而提升以往需要多次交互的任务性能。
企业级编码与知识工作性能
Argon 的多模态推理和长上下文能力在多个基准测试套件中表现出顶级水平:
- DeepSWE v1.1 – 准确率达到 77.9 %,为长周期软件工程任务树立了新的行业标杆。
- Vals Index – 在综合经济影响基准中领先,该基准根据美国 GDP 贡献权重对金融、编码、法律和税务工作进行加权。
- Vals Finance Agent v2 – 在多步骤金融研究任务中表现最佳。
- Harvey’s Legal Agent Benchmark – 在法律研究和起草任务中得分最高。
- AutomationBench (Zapier) – 在端到端业务流程自动化任务中排名第一,得分为 51.3 %。
- LVBench – 在长视频理解任务中达到行业领先水平,得分为 91.7 %。
这些结果展示了 Argon 在文本密集型、多模态和多步骤企业工作流中的多功能性。
防御性网络安全能力
Argon 已针对网络安全防御进行了微调,并将向可信防御者 不设网络安全特定防护机制 地发布,以充分展现其全部能力。显著成果包括:
- 漏洞发现 – 在 Google 内部基准测试中,Argon 在 20 种编程语言的代码库中识别出广泛的安全暴露。
- Wiz Scan‑for‑Good 合作 – Argon 在全球医疗软件中发现了一个关键漏洞,暴露了个人数据,这一风险此前的前沿模型未能识别。
- CWE‑bench v1 – 以 68 % 的修复得分并列第一,优于 3.8 Flash Cyber 模型在 CWE‑bench v0 上的表现。
- Wiz 内部渗透测试 – 在攻击面映射、漏洞识别和概念验证生成方面均优于 3.8 Flash Cyber。
加强前沿安全防护
在全面发布前,DeepMind 正在强化四大安全防护类别:
- 滥用预防 – Argon 拒绝协助网络、化学、生物、放射或核攻击的请求,同时允许合法的双重用途研究。鲁棒性测试包括内部和外部红队演练以及对内部激活的监控(参见 arXiv:2601.11516)。
- 提示注入防御 – Argon 在 Gray Swan 间接提示注入基准测试中表现出领先水平,通过自动化红队演练和对抗训练实现。
- 对齐监控 – 通过思维链和行为监控,当模型偏离用户意图时立即停止执行;警报将发送至专门的事件响应团队。
- 系统加固 – 在高风险训练或评估前,沙箱环境将被隔离并密封,遵循 DeepMind 的代理控制路线图。
DeepMind 呼吁更广泛的 AI 社区采用推理透明性实践,以确保对齐工作期间模型思维的可观察性。
发布时间表
Gemini 4 Argon 将首先向 Fairwind 计划的可信网络安全防御者群体提供。后续阶段将逐步扩展至开发者、企业及消费者,从付费 API 客户和 Google AI Ultra 订阅用户开始。
意义
- 生产力提升 – 1 M 标记上下文和先进的推理能力使开发者和知识工作者能够处理以往需要大量人力或多次模型调用的任务。
- 安全影响 – 通过自动化漏洞发现和补丁生成,Argon 可能加速整个软件供应链的修复周期。
- 安全考量 – 分阶段发布和广泛的安全防护开发体现了 DeepMind 对前沿能力负责任部署的承诺。
参考资料
- Fairwind 计划 – https://deepmind.google/fairwind-program/
- 前沿安全框架 – https://deepmind.google/blog/strengthening-our-frontier-safety-framework/
- 代理控制路线图 – https://deepmind.google/blog/securing-the-future-of-ai-agents/
- Gray Swan IPI 基准 – https://grayswan.io/benchmark/ipi
- CWE‑bench – https://cwe-bench.com/
- Vals Index – https://www.vals.ai/benchmarks/vals_index
- DeepSWE v1.1 – https://github.com/deepswe/evaluation
*本文基于 DeepMind 官方博客文章《Gemini 4 Argon:我们前沿智能的新纪元》(2026 年 9 月 30 日发布)。