各大科技巨头纷纷把战场转向Agent领域之际,Google的新一代旗舰模型正式推出。
Gemini 4系列首款旗舰产品——Gemini 4 Argon于美国时间9月30日亮相。
Google官方表示,该模型专为软件工程实践、企业级知识工作和网络安全防护设计,代表了Gemini家族目前的最高能力水平。
与前代旗舰版本相比,这次发布的时间间隔确实相当漫长。
早在7月,彭博社就报道称原定发布的3.5 Pro版本已严重延期,Google仍在重点突破代码生成这一核心短板。
最后,Google决定直接跳过3.5 Pro,推出4 Argon版本。
Argon在各类权威评测中排名靠前。但据彭博援引知情人士称,该模型一旦投入真实业务场景,性能就会明显衰减,尤其是部分代码处理和界面设计任务上容易出现「卡壳」。某些Google内部人士则认为,Anthropic和OpenAI的旗舰产品更新速度已经超越Gemini。
这是一份迟来且充满争议的成绩单。
长上下文与成本优化
Argon最具革命性的升级体现在输出上下文规模上,达到了100万Token的业界最高水平,远超GPT-6 Astra的12.8万Token和前代Gemini的6.4万Token。
按照常规英文字数换算,单次可生成数十万单词的内容。这种扩展让模型在处理复杂任务时能力大幅提升,原本容易因长度限制而中断的工作流程现在可以顺利完成。
在成本层面,Google保持了其一贯的竞争力定价。Argon推出价为每百万Token输入2美元、输出10美元——输入费用与3.1 Pro保持一致,输出成本反而从原来的12美元降低到10美元。
Google强调,Argon在代码开发和学术研究两个关键领域实现了质的飞跃。
Google内部迄今已有数千位员工把这个模型纳入了日常工作流:
算法突破:量子计算部门利用Argon完成一项算法改进,耗时不过数分钟便让性能指标提升了40%
代码重构:在开源视频解码工具libgav1的升级中,Argon Agent持续对编译器信息进行优化迭代,最终改写了3.2万行SIMD指令集代码。按Google公开的数据,新的Rust实现比原始版本快了2.7倍,同时保证了视频解码质量完全不变。
接下来看一下基准测试成绩。

首先来看它最想展示的编程领域。在衡量现实环境中长周期软件工程能力的DeepSWE v1.1测试中,Argon取得77.9%的新高。Google给出的对标数据显示,Claude Opus 5.5为74.2%,GPT-6 Astra为74.1%,Argon领先约4个百分点。
在企业工作流方面,AutomationBench的成绩为51.3%,比Opus 5.5的42.5%和Astra的41.4%分别高出近10个百分点。
金融数据分析同样表现突出。Vals Finance Agent v2中,Argon拿下65.4%,超过Opus 5.5的58.6%和Astra的53.5%。
法律文件处理的得分尤为亮眼。在Harvey的法律Agent评测中,Argon得到19.6%,而Google列举的三个对手都未突破7%。
多模态理解方面,Google表示该模型可以分析复杂的技术图表、从长篇视频中提取关键细节,能根据大量文档集合执行复杂操作。在长视频理解基准LVBench上,它达到了91.7%,Google称这代表目前的最先进水平。
在备受瞩目的网络防护领域。Argon可以执行防御性的安全检测工作,并通过构建安全Agent来发现漏洞、验证漏洞、生成修复代码。
与安全公司Wiz合作的「Scan for Good」项目中,Argon成功发现了一个全球医院广泛使用的医疗系统内的高危漏洞,该漏洞可能导致患者隐私泄露——而此前测试过该系统的其他先进AI模型均未能识别。
在CWE-bench v1漏洞修复评测中,Argon取得68%的成绩并列第一。在Wiz进行的黑盒渗透测试中,即便看不到源代码,它也能分析真实的Web应用系统,定位攻击入口点、寻找可利用的漏洞,并生成实际PoC代码来确认漏洞存在。
不过,Argon目前并未面向全社会开放,而是通过「Fairwind计划」优先向一批经过审查的网络安全防御机构提供,同时参与美国政府举办的上市前自愿模型审查流程。完全向开发者、企业和用户开放还需等待时日。
然而,Argon的漂亮测试数据背后也存在不少质疑之声。
最直接的疑问来自Google自己的内部。彭博社援引与Gemini 4项目关系密切的人士的话说,虽然Argon在公开测试中表现抢眼,但员工们把它用在实际工作流中时,性能确实下滑明显,尤其是某些代码处理和界面设计任务上容易出现「卡机」。
不过,Google方面对「实际代码能力显著下滑」的说法予以否认,并表示内部普遍评价Gemini 4已经处于行业前沿。
业界独立评测机构则给出中肯评价:Argon主要在长文本处理、企业工作和部分工程任务上表现卓越,但并非所有代码场景下都是「绝对最强」。
Google的现实困境
Gemini 4的推出,结束了Google在旗舰模型更新上近一年来的频繁摇摆。
这一年里,Google并没有停止新品发布。恰恰相反,Flash系列迭代速度很快,3.6、3.7、3.8版本在数月内陆续推出。
但Gemini 3.5 Pro原本计划在今年6月亮相,却始终没能按时交付。到了7月,Google对外只能说该模型仍在有限的合作测试中。最后,3.5 Pro遭到放弃,Google直奔Gemini 4。
这段沉寂期引发了大量的市场讨论——Google难道真的在AI竞争中掉队了?
路透社的报道显示,3.5 Pro的延期跟Google DeepMind内部的组织调整和人事变化息息相关。公司联合领导人兼首席执行官Demis Hassabis逐步退出了核心管理层,包括Jeff Dean在内的若干Gemini项目主要负责人也相继离职。与此同时,OpenAI和Anthropic还从Google挖角了多位顶级研究人员。
到了今年7月,Google CEO桑达尔·皮查伊在财务电话会议上特意用较长篇幅为Google的AI发展战略进行解释。
他反驳了「Google在AI竞争中失利」的论点,强调「不应该只盯着某一款Pro版本的表现」,Google的Flash系列仍在加速迭代,Gemini 4即将带来更大飞跃。同时他指出,评估Google的AI竞争力应该放在更大格局中——把Cloud服务、自主研发的TPU芯片和整个生态产品体系一起纳入考虑。
其实,如果把目光从模型排名榜单上收回来看整个Google公司,「掉队」这个判断就站不住脚。
母公司Alphabet最新发布的2026年二季度财报显示营收达1198亿美元,比去年同期增长24%。
其中Google Cloud部门的收入同比增幅高达82%,达到248亿美元,营业利润从上年同期的28亿美元飙升至88亿美元。Google透露,Gemini模型目前每分钟处理的API Token数达220亿,Gemini App月度活跃用户已突破9.5亿人,近九成的财富百强企业已部署了Gemini Enterprise版本。
曾经被业界认为最容易被ChatGPT打败的搜索业务,至今仍没有显示衰退迹象。
二季度Google搜索及其他业务总收入达632.7亿美元,较上年同期增长17%。Alphabet指出,AI增强功能正在拉动搜索量上升。

这一点正是Google与多数AI初创公司最本质的差异。Google已经拥有搜索、云服务、视频网站、手机操作系统、浏览器,还自行制造TPU芯片,这些形成了其强大的竞争壁垒。
然而,船大也易难掉头,积累的产品线与资源越多,需要协调统筹的人力与要素就越多。
眼下各大企业纷纷向Agent之路开进,Google的战船究竟驶向何方呢?