无论是在真实的软件工程、法律与金融等企业知识工作,还是网络安全防御领域,Gemini 4 Argon 都能应对复杂的工作流,展现出前沿级别的卓越性能。
作者:Koray Kavukcuoglu,Google DeepMind 高级副总裁 兼 Google 首席AI架构师
今天,我们正式推出了全新的前沿 AI 模型——Gemini 4 Argon。目前,我们正通过“Fairwind 计划”,率先向一批信赖的网络安全专家开放试用。Argon 专为处理复杂、长流程任务中的深度推理而设计,它已经从根本上改变了 Google 内部的工作和开发方式。无论是在真实的软件工程、法律与金融等企业知识工作、还是网络安全防御领域,Argon 都能应对极具挑战的工作流,展现出顶尖的性能。
前沿技术能力的安全释出会分阶段展开。我们正在积极参与美国政府的模型发布前自愿评估流程,并同步逐步放开访问权限。在开发者、企业和用户使用之前,Google 会持续收集早期测试者的反馈,进一步完善安全防护机制。
Argon 的首发优惠价1为:输入token每百万个 2 美元,输出token每百万个 10 美元,缓存输入token在输入token价格上享受 95% 的折扣。
重塑 Google 的工作与开发方式
Gemini 4 Argon 已开始为 Google 内部的工作流提供支持。数以千计的 Google 员工表示,该模型在专业代码编写、深度研究以及写作质量方面表现尤为突出。它不仅在帮助团队加快开发进度、突破工程生产力的极限,还在加速各项技术突破:
量子算法优化: 在量子计算研究中,Argon 正帮助我们的研究人员优化限制关键应用性能的“时空资源”(量子比特数 × 量子逻辑门数)。在一个实际案例中,它仅用几分钟就将已知公开的最佳基准提升了 40%。
内存使用效率: Argon Agent 团队通过分析全集群性能遥测数据,实现了 Google 数据中心内存优化的自主识别与部署,项目一经上线即释放超 300 TiB 内存,预计整体内存节省规模将达 500 TiB 到 1 PiB。
超大规模代码库迁移与优化: Argon Agent 正在将 Google 内部的 C/C++ 代码库向 Rust 迁移——处理规模从小到核心库(如 re2、libgav1)的几万行代码,大到 Fuchsia OS Zircon 内核超 80 万行的庞大系统。鉴于其中许多系统至关重要,此类大规模重写在正式部署到生产环境之前,都会经过严苛的自动化与人工审计、仿真测试以及层层代码复核。
针对 Google 的开源视频解码软件 libgav1,Argon Agent 基于现有的 Rust 移植版本展开优化,通过多轮性能引导(profile-guided)分析实验与编译器输出研究,生成了可实现自动向量化的安全 Rust 代码,从而成功替换了 3.2 万行 SIMD 代码,最终打造出一款内存安全的视频解码器,它的运行速度比原 Rust 移植版快了 2.7 倍,视频输出完全一致,性能已非常接近高度优化的 C++ 版本。
倾力解决您最棘手的难题
为了让 Gemini 4 Argon 能够应对更长、更复杂的使用场景,我们将模型的输出token上限大幅提升至行业领先的 100 万,而此前这一限制为 6万4。当模型拥有足够的发挥空间去展开深度思考、并在单次推演中生成数十万token时,它的推理深度将提升至全新高度,从而能够一步到位地解决各类硬核难题。
实现跨领域的编码和企业工作流程
Gemini 4 Argon 在代码编写、逻辑推理和多模态方面拥有出色能力, 同时具备处理长流程、多步骤任务的持续执行力,使其能在各种企业工作流中脱颖而出。
Google 工程师们已将 Argon 融入日常,用它来处理从代码调试到大规模代码库迁移,再到算法设计等各种任务。特别是在衡量真实世界的、长周期软件工程任务 DeepSWE v1.1 基准测试中,Argon 以 77.9% 的得分刷新了行业纪录。
除了代码编写,Argon 在 Vals 指数中也名列前茅。Vals 指数用于衡量金融、编码、法律和税务工作的经济影响,每个行业都根据其对美国 GDP 的贡献进行加权。我们在其他特定领域的评估中也看到了类似的领先表现,例如 Vals Finance Agent v2(多步骤财务研究)和 Harvey’s Legal Agent Benchmark(法律研究和起草)。在 Zapier 的 AutomationBench 基准测试中,Argon 以 51.3% 的得分位居榜首,该基准测试衡量核心业务功能的端到端执行力。
引领防御性网络安全
为了让网络安全人员更好地应对新时代的网络攻击,我们对 Gemini 4 Argon 进行了专项训练,赋予了它极强的网络安全防御能力。Argon 能够自主发现、验证并修复关键的软件漏洞。对于信赖的安全员以及 Google 内部团队,我们将提供无网络安全护栏的 Argon 版本,以便他们充分发挥其前沿级别的安全防御能力。
网络安全公司 Wiz 已经通过其“Scan for Good”倡议将 Argon 应用于网络安全防御——该项目旨在通过寻找并修复高危漏洞,免费保护关键的公共基础设施。在早期效果展示中,该模型成功发现了一处影响全球医院所用医疗软件的致命漏洞,该漏洞会导致敏感个人信息泄露,而此前的前沿模型均漏掉了这一严重风险。
在评估模型安全漏洞修复能力的 CWE-bench v1 测试中,Argon 以 68% 的最高分并列第一,这是在 3.8 Flash Cyber 于 CWE-bench v0 取得的优异表现之上的进一步突破。
与 3.8 Flash Cyber 相比,Gemini 4 Argon 在漏洞发现能力上实现了令人瞩目的飞跃。例如:
系统加固:随着前沿模型的能力日益增强,对其进行安全地测试需要能够与系统自身能力相匹配的安全环境。为了与智能体控制路线图保持一致,我们在高风险训练或评估开始前,通过隔离和密封来加固沙盒环境。我们致力于与合作伙伴分享这些智能体安全最佳实践,以提升整个生态系统的安全性。
即将上线
我们打造了具备前沿级编程、知识工作、网络安全防御和创意写作能力的 Gemini 4 Argon,使其成为开发者、专业人士和企业攻克棘手问题的得力伙伴。我们非常感谢首批网络安全防御人员和信赖的测试人员,他们的实地评估与反馈将帮助我们在面向开发者、企业和用户(从付费 API 客户和 Google AI Ultra 订阅者开始)发布之前进一步强化我们的系统。
在 2026 Google I/O Connect China 现场,来自 Google 和行业的嘉宾与近 2,000 名开发者齐聚上海,围绕智能体时代的技术、工具及开发者应用实践进行了深入探讨,解析中国创新力量如何借助全栈 AI 加速发展,实现在全球市场的可持续增长。
在智能体时代,Google 坚持走一条独有的全栈式 AI 创新路线:从定制芯片、安全稳固基础设施、到前沿的研究与模型,再到触达全球用户的产品和平台。我们正在以前所未有的速度,将这些创新无缝融入覆盖全球数十亿用户的全链路产品生态,赋能中国开发者在海外高效创新,全力助推中国企业海外增长。
这种全栈式 AI 赋能实现了从夯实产品海外落地的数字基座,到引领海外商业体验,再到实现物理世界的具身智能的创新进化的全面落地。而除了赋能个体项目,Google 更希望激发在全球范围内的颠覆性创新,汇聚推动中国企业前行的”行动势能”。通过启动“谷歌初创出海计划”与拓展“谷歌跨境电商加速中心”,我们整合 Google 生态的核心出海方案与平台资源,为初创企业打造 AI 驱动的全栈式增长引擎,协助建立全新的跨境出海产业生态。
随着 Gemini 3.6 Flash、3.5 Flash-Lite 等新一代模型的推出,AI 能够为极其复杂的任务进行深度逻辑推理,成为了 AI 智能体最坚实的底层基石。
在日常工作中,开发者可以利用 Gemini API 中的“托管式智能体”轻易构建能够自主分类整理问题、分析 Bug,并维护 SDK 健康运行的智能体。只需一次 API 调用,开发者就能同时获得智能体以及可供它安全运行的远程环境。通过 AI Studio,开发者可以在几分钟内完成从 JSON 文件到原生 Android 应用的构建,并能进一步在 Google Antigravity 2.0 平台上进行本地迭代。
此外,Gemma 4 以及 Gemma 4 12B、DiffusionGemma 等更多开放模型的推出,进一步促进了开发者社区的繁荣生态。开发者们已经使用这些模型打造了一些令人惊艳的突破性产品。更为重要的是,在离线状态下,开发者也能在笔记本电脑和手机本地运行强大的 AI 智能体,为全球用户带来了速度快、性价比超高的体验。
如今 Android 的版图已远不止于智能手机,从折叠屏、平板、可穿戴设备、电视、车机到 XR 等终端,Android 活跃大屏设备已突破 5.8 亿。我们正致力于帮助开发者能更快速、更轻松地构建高质量的 Kotlin Android 应用,并将其推广到全球超过 30 亿终端设备上,提供跨越所有终端的无缝体验。
为了提升开发质量,我们推出了三项核心更新。Android CLI 与智能体结合:通过整合 Android 技能和知识库,智能体在处理繁琐任务时能减少约 70% 的词元(token)使用,并将任务完成速度提高最多三倍;Android Studio 智能体模式:支持在 IDE 中开启智能体模式,并允许开发者自由选择远程模型或下载本地模型进行离线深度开发;Android Bench 评估工具:专门用于衡量大模型在应对真实 Android 开发挑战时的成本、延迟和词元消耗,帮助开发者确定最适合其流程和政策的模型。
在 UI 开发标准上,我们全面推行 Compose 优先策略。此外,为了支持大规模测试,DDP Device Streaming 已进入公开预览阶段,支持开发者远程获取真实的物理设备,并利用具备智能分片功能的 DeviceRun 在多台真实设备上并发执行测试。
最后,在提升应用质量与安全性方面,通过将智能体与最新的 API(如 IntentSanitizer)结合,开发者可以更有效地消除签名验证等安全漏洞,确保只有受信任的流量进入应用,从而构建更高质量的 Android 生态。
Web 平台也正迎来重大的变革。Web 功能日益丰富,越发具有表现力,Web 生态也迎来了新型用户:智能体。而我们核心的目标是优化真人用户体验、适配智能体工具并革新现代 Web 开发工作流。为了让大家更容易打造出“秒开”体验,Web 平台在 Core Web Vitals 中引入了“软导航”性能衡量机制,并推出一系列颠覆网站开发范式的新原语,在化繁为简的同时,更要打破边界,把曾经的不可能变成现实。
在能力扩展方面,我们正在不断扩展浏览器内置端侧 AI 工具箱,支持跨源调用并能够在本地硬件运行优化模型,重塑浏览器能力边界。针对智能体这一新型用户的涌现,Web 平台也推出了实验性开放规范 WebMCP,支持 Web 应用将 JavaScript 函数和 HTML 表单等结构化工具直接公开给智能体。这使得 Web 能够成为智能体工作流中被优先调用的对象,引导工具更高效地执行搜索、加购或账号管理等操作任务。
与此同时,为了让 AI 开发工具始终紧跟最新的 Web 开发,Modern Web Guidance 提供了一整套经专家把关、实时更新的精选技能 (skills),确保获得质量更优的代码产出,并能基于 Baseline 目标自动生成向后兼容的兜底代码。此外,我们还持续深耕面向智能体的 Chrome 开发者工具,使编程工具能自主实时调取运行时调试数据并执行审核自主修复,形成极少需要人工干预的强大开发反馈环。
在智能体时代,模型训练与部署的需求已经完全分化。为了满足这些爆发式增长的算力需求,第八代 TPU 专为训练和推理这两类截然不同的需求从零打造。
TPU 8t 是专为模型训练打造的强劲引擎。它通过将块级乘法移至 MXU 内部,利用原生量化技术消除 VPU 开销,使单 Pod 计算性能提升至上一代的近三倍,重新定义了算力性能。而 TPU 8i 则专注于推理与强化学习等“思考”环节。其利用全新的 Boardfly 拓扑网络,让数百万计的智能体能够以近乎零延迟并发运行。
智能体需要依托于平台。通过 Google Agent Platform 的 Agent Studio ,开源的近 50 个智能体技能,以及 60 多个托管 MCP 服务器,Google Cloud 为智能体的开发、与智能体的协同开发提供支持。此外,专属的 Agent Runtime,则帮助实现大规模智能体的部署、运行与治理。Google Cloud 平台还支持多种智能体协同运行方式,提供自主化的故障排查、性能优化与核心资源持续防护支持。
过去这一年,全球 AI 创新浪潮汹涌澎湃,而中国开发者正以猛烈的势头乘风破浪,通过打造自主智能体推动一切加速向前。AI 也从最初回答问题的聊天机器人,到执行任务的工具,进化为如今只需设定目标就能自主推理、做计划并搞定复杂任务的自主智能体。
在此背景下,开发者的角色也发生了重要转变:从编写每一行代码转变为定义规范和评估测试平台,每一位开发者都成为了“智能体的管理者”,从而放大其远见与影响力。过去需要多名成员耗时数月才能完成的项目,如今个人在极短时间内即可完成。这种“杠杆效应”赋予了每位开发者背后拥有一支强大工程团队的实力。
为了支撑这种创新,通过本土社区连接、技术导师指导、出海创业加速计划以及本地化的中文技术文档这四大核心支柱,Google 致力于将本土创新与全球规模化连接,利用工具赋能开发者,突破极限潜能,共同引领未来智能体 AI 的指数级增长。
作者:Keerat Sharma,Google 广告隐私与安全部门副总裁&总经理
2025 年,Gemini 赋能的工具显著提升了我们检测与阻止不良广告的能力:超过 99% 的违规广告在触达用户前,就被我们的系统成功拦截了。此外,我们也在不断完善防御机制,以应对最先进的欺诈手段。
更高的拦截精准度长期以来,我们的安全团队一直使用先进 AI 来识别并阻止诈骗者,而 Gemini 则将这项工作提升到了全新高度。我们的模型通过分析包括账户注册时长、行为特征及投放模式在内的数千亿条信号,在威胁触达用户前便能将其拦截。与之前基于关键词的系统不同,最新模型能更精准地理解意图,更有效地识别恶意内容并抢先将其拦截,即便是对刻意规避检测的内容也不例外。这种积极的防御手段有效遏制了不良行为者。2025 年,我们拦截或移除了超过 83 亿条广告,并暂停了 2490 万个账户;其中,涉及诈骗的广告达 6.02 亿条,相关账户达 400 万个。在通过技术手段拦截大部分违规行为之外,我们还新增了广泛的广告客户验证(Advertiser verification)计划,这也构成了另一道至关重要的防线。我们通过身份验证,在不良行为者进入系统前将其阻止,从而建立用户对广告及其背后企业的信任。
先发制人不良行为者利用 AI 大规模生成欺诈广告,而 Gemini 帮助我们实现了实时检测与拦截。截至去年底,Google Ads 中的多数自适应搜索广告(Responsive Search Ads)已实现即时审核,并在提交阶段就拦截了有害内容。今年,我们将把这项技术应用到更多广告形式中。Gemini 还使我们能够更高效地处理用户反馈, 2025 年,帮助团队处理的用户举报量达到了前一年的四倍以上。这意味着,即使偶有威胁成为“漏网之鱼”,我们也能迅速将其消除。这种响应速度可以让安全专家专注于处理更复杂、需要人工判断的任务。
兼顾安全与助力企业通过对图像和文本之外更深层次的分析,Gemini 可以区分出真实优惠与复杂的欺诈陷阱,正是这种细致的辨别能力,让我们在去年将错误暂停广告主账号的情况降低了 80%。这种精准度可以让我们双管齐下:在优先移除有害内容的同时, 也能够保障诚信企业的广告稳定投放。随着威胁手段不断演变,Gemini 确保我们的防御始终领先一步。
“游戏”标签页新增 PC 专区与 PC 徽章,助力拓展你的 PC 游戏触达范围
借助游戏试玩降低转化门槛 为了更顺畅地转化高意向买家,我们推出了 Game Trials(游戏试玩) 功能,让玩家在移动端购买前可以限时体验游戏。该功能可直接从商店列表访问,玩家只需轻轻一点,即可快速开启探索之旅。目前该功能正针对部分作品进行测试,并即将向更多开发者开放。