作者:Koray Kavukcuoglu,Google DeepMind 高级副总裁 兼 Google 首席AI架构师

今天,我们正式推出了全新的前沿 AI 模型——Gemini 4 Argon。目前,我们正通过“Fairwind 计划”,率先向一批信赖的网络安全专家开放试用。Argon 专为处理复杂、长流程任务中的深度推理而设计,它已经从根本上改变了 Google 内部的工作和开发方式。无论是在真实的软件工程、法律与金融等企业知识工作、还是网络安全防御领域,Argon 都能应对极具挑战的工作流,展现出顶尖的性能。
前沿技术能力的安全释出会分阶段展开。我们正在积极参与美国政府的模型发布前自愿评估流程,并同步逐步放开访问权限。在开发者、企业和用户使用之前,Google 会持续收集早期测试者的反馈,进一步完善安全防护机制。
Argon 的首发优惠价1为:输入token每百万个 2 美元,输出token每百万个 10 美元,缓存输入token在输入token价格上享受 95% 的折扣。
重塑 Google 的工作与开发方式
Gemini 4 Argon 已开始为 Google 内部的工作流提供支持。数以千计的 Google 员工表示,该模型在专业代码编写、深度研究以及写作质量方面表现尤为突出。它不仅在帮助团队加快开发进度、突破工程生产力的极限,还在加速各项技术突破:
量子算法优化: 在量子计算研究中,Argon 正帮助我们的研究人员优化限制关键应用性能的“时空资源”(量子比特数 × 量子逻辑门数)。在一个实际案例中,它仅用几分钟就将已知公开的最佳基准提升了 40%。
内存使用效率: Argon Agent 团队通过分析全集群性能遥测数据,实现了 Google 数据中心内存优化的自主识别与部署,项目一经上线即释放超 300 TiB 内存,预计整体内存节省规模将达 500 TiB 到 1 PiB。
超大规模代码库迁移与优化: Argon Agent 正在将 Google 内部的 C/C++ 代码库向 Rust 迁移——处理规模从小到核心库(如 re2、libgav1)的几万行代码,大到 Fuchsia OS Zircon 内核超 80 万行的庞大系统。鉴于其中许多系统至关重要,此类大规模重写在正式部署到生产环境之前,都会经过严苛的自动化与人工审计、仿真测试以及层层代码复核。
针对 Google 的开源视频解码软件 libgav1,Argon Agent 基于现有的 Rust 移植版本展开优化,通过多轮性能引导(profile-guided)分析实验与编译器输出研究,生成了可实现自动向量化的安全 Rust 代码,从而成功替换了 3.2 万行 SIMD 代码,最终打造出一款内存安全的视频解码器,它的运行速度比原 Rust 移植版快了 2.7 倍,视频输出完全一致,性能已非常接近高度优化的 C++ 版本。
倾力解决您最棘手的难题
为了让 Gemini 4 Argon 能够应对更长、更复杂的使用场景,我们将模型的输出token上限大幅提升至行业领先的 100 万,而此前这一限制为 6万4。当模型拥有足够的发挥空间去展开深度思考、并在单次推演中生成数十万token时,它的推理深度将提升至全新高度,从而能够一步到位地解决各类硬核难题。

实现跨领域的编码和企业工作流程
Gemini 4 Argon 在代码编写、逻辑推理和多模态方面拥有出色能力, 同时具备处理长流程、多步骤任务的持续执行力,使其能在各种企业工作流中脱颖而出。
Google 工程师们已将 Argon 融入日常,用它来处理从代码调试到大规模代码库迁移,再到算法设计等各种任务。特别是在衡量真实世界的、长周期软件工程任务 DeepSWE v1.1 基准测试中,Argon 以 77.9% 的得分刷新了行业纪录。
除了代码编写,Argon 在 Vals 指数中也名列前茅。Vals 指数用于衡量金融、编码、法律和税务工作的经济影响,每个行业都根据其对美国 GDP 的贡献进行加权。我们在其他特定领域的评估中也看到了类似的领先表现,例如 Vals Finance Agent v2(多步骤财务研究)和 Harvey’s Legal Agent Benchmark(法律研究和起草)。在 Zapier 的 AutomationBench 基准测试中,Argon 以 51.3% 的得分位居榜首,该基准测试衡量核心业务功能的端到端执行力。

引领防御性网络安全
为了让网络安全人员更好地应对新时代的网络攻击,我们对 Gemini 4 Argon 进行了专项训练,赋予了它极强的网络安全防御能力。Argon 能够自主发现、验证并修复关键的软件漏洞。对于信赖的安全员以及 Google 内部团队,我们将提供无网络安全护栏的 Argon 版本,以便他们充分发挥其前沿级别的安全防御能力。
网络安全公司 Wiz 已经通过其“Scan for Good”倡议将 Argon 应用于网络安全防御——该项目旨在通过寻找并修复高危漏洞,免费保护关键的公共基础设施。在早期效果展示中,该模型成功发现了一处影响全球医院所用医疗软件的致命漏洞,该漏洞会导致敏感个人信息泄露,而此前的前沿模型均漏掉了这一严重风险。
在评估模型安全漏洞修复能力的 CWE-bench v1 测试中,Argon 以 68% 的最高分并列第一,这是在 3.8 Flash Cyber 于 CWE-bench v0 取得的优异表现之上的进一步突破。

与 3.8 Flash Cyber 相比,Gemini 4 Argon 在漏洞发现能力上实现了令人瞩目的飞跃。例如:
- 在 Google 的内部综合漏洞测试中, Argon 在涵盖 20 种编程语言的复杂代码库中,挖掘出了涵盖面极广的安全隐患。
- 在 Wiz 的内部黑盒渗透测试中,该测试主要评估无源码环境下的实时 Web 系统分析能力,Argon 在攻击面识别、漏洞发现及概念验证(PoC)证据生成等维度上,全面超越了 3.8 Flash Cyber。

在广泛推出之前加强前沿安全保障
在全面推出 Gemini 4 Argon 之前,我们将继续在四个关键领域加强前沿安全保障措施:
防范滥用:为防止恶意行为者将 Argon 用于网络攻击或化学、生物、放射性与核武器(CBRN)攻击,根据我们的前沿安全框架 (Frontier Safety Framework),该模型被设计为能拒绝有害请求,同时保留合法的双重用途科学研究。针对本次发布,我们强化了安全护栏,包括升级内部激活监测技术以识别违规行为。这些防护措施已经通过内部和外部红队结合手动与自动攻击的方法进行了稳健性测试。
抵御提示词注入攻击:Argon 也是我们迄今为止在防范间接提示词注入(利用恶意指令或上下文劫持模型行为)方面最具韧性的模型。这些攻击非常复杂,需要持续保持警惕并采取多层防御措施。通过自动化红队测试和对抗性训练,Gemini 4 Argon 在 Gray Swan 的间接提示词注入(IPI)基准测试中,其提示词注入的稳健性处于领先地位。

对齐监测:为防止 Argon 在尝试完成任务时出现超越用户意图的越界行为,我们正在部署针对对齐失效的防范措施,以监测 Argon 的思维链与行动,并在必要时中止执行。
我们使用类似的系统来监控我们的训练运行,并向专门的事件响应团队发送警报。我们采取了谨慎的预防措施,避免将研究结果反馈回训练中,以免导致 Argon 形成规避监控的推理能力。我们强烈鼓励业界同仁在应对对齐风险的同时,在模型能力提升的关键时刻,保持推理过程的透明度,以确保模型的思考过程依然有助于识别和诊断不对齐问题。
系统加固:随着前沿模型的能力日益增强,对其进行安全地测试需要能够与系统自身能力相匹配的安全环境。为了与智能体控制路线图保持一致,我们在高风险训练或评估开始前,通过隔离和密封来加固沙盒环境。我们致力于与合作伙伴分享这些智能体安全最佳实践,以提升整个生态系统的安全性。
即将上线
我们打造了具备前沿级编程、知识工作、网络安全防御和创意写作能力的 Gemini 4 Argon,使其成为开发者、专业人士和企业攻克棘手问题的得力伙伴。我们非常感谢首批网络安全防御人员和信赖的测试人员,他们的实地评估与反馈将帮助我们在面向开发者、企业和用户(从付费 API 客户和 Google AI Ultra 订阅者开始)发布之前进一步强化我们的系统。