谷歌新模型反击战:Argon追平Astra,价格只要一半

谷歌新模型反击战:Argon追平Astra,价格只要一半

谷歌CEO桑达尔·皮查伊。图片由AI生成

自上一款旗舰级产品问世至今,谷歌的脚步停留了七个月之久。如今这家科技巨头终于再次出招,这一回它打算通过扩大功能范围和降低成本价格,来重新坐回AI前沿的交椅。

北京时间十月一日,谷歌DeepMind官方发表了全新的Gemini 4 Argon。作为该公司在超过半年时间里首度问世的、超过Flash档次的尖端自研模型,其设计初衷是为软件工程、企业知识处理和网络防御等三大领域提供支持。

Gemini 4 Argon在多项测试中的表现令人瞩目:谷歌公布的十八项基准评估里,它在十二项上取得优势、一项实现并列领先,整体压倒了GPT-6 Astra与Claude Opus 5.5。

AMP

根据独立评测机构Artificial Analysis发布的智能指数,Argon获得53分,与GPT-6 Astra不分上下。

AMP

在第三方测评平台Arena.ai的Text Arena排行榜中,Argon凭借1525分的战绩位列榜首。

AMP

价格战略无疑是Argon的另一大看点。谷歌并未将其定位为高端旗舰产品,而是着力降低调用成本和缓存使用费,进一步拉低使用门槛,力求在性能出众之外,建立更深层的成本竞争力。

只是普通消费者暂时还无法获得。Argon会先通过Fairwind计划向获得认可的网络防卫专业人士推出,同步参加美国政府的自愿测试项目。大范围推广会从购买API服务的客户和Google AI Ultra会员着手,具体推出日期目前未定。

对谷歌而言,这次发布的价值远不只是推出一款新产品。在过去大半年的时间里,Gemini 3.5 Pro因为一再延期而最终夭折,OpenAI和Anthropic不断快速更新升级,双方的差距越来越大,公司内部还经历了人才出走和高管层的频繁改组。Argon可看作是谷歌针对「已经掉队」这一评价的核心应答。

01 基准领跑,但并非全面压倒

从各项基准测试的数据来看,Argon给出了一份令人满意的成绩单,其优异表现主要集中在企业级和超长上下文的工作场景。在Harvey法律代理基准测试中,Argon的得分为19.6%,超过排名第二的产品三倍多。Zapier的AutomationBench端对端业务执行测试里,Argon以51.3%的分数遥遥领先。

财务领域的表现上,Vals Finance Agent v2获得65.4%的分数,领先Claude Opus 5.5和GPT-6 Astra两款产品。在代码编写范畴,DeepSWE v1.1这一长周期软件工程考核中,Argon以77.9%占据第一位。长视频理解这项基准LVBench的测试中,Argon的分数达到91.7%。网络安全CWE-bench v1测试里,则与GPT-6 Astra并列榜首。

Artificial Analysis重点强调了Argon的两个优点:

其一是Argon的错误率水平仅为15%,在智能指数得分四十五分及以上的同类产品中属于最低水平,远低于GPT-6 Astra的51%。在把握不足时,Argon倾向于承认其局限,而不会盲目推测。

其二是Argon对输出token的限制到达一百万,这比之前的6.4万足足多了十五倍有余,这对于智能体编程、审查和迁移这类长流程工作尤其重要。

AMP

AI领域观察者@notjazii评价说,谷歌的工程师团队在这款模型上倾注了不少心血。最低错误率、Vals指标第一、Text Arena排名第一、AA得分53与Astra比肩、单任务成本更低——几乎在绝大部分测试项目上都排在第一或第二位。

AMP

然而Argon也不是全能者,它在好几个关键指标上表现滞后,特别是FrontierSWE v2和Terminal-Bench Science 0.1这两项,GPT-6 Astra在这里都领先了十多个百分点。Claude Opus 5.5在Terminal-bench 4.0这项测试中领先大约九个百分点。

与此同时,据彭博社报道,谷歌内部有员工对Gemini 4在真实表现上持有保留态度,尤其是编程领域。虽然基准分数看着不错,但在实际应用场景下处理某些代码任务时效果并不突出,前端设计的能力尤为薄弱。

内部的分析认为,这种现象来自于「为基准优化」的现象——工程师把更多精力用在提升基准成绩上,反而忽视了产品的实际可用性。初创公司Surge AI的创办人埃德温·陈(Edwin Chen)打过一个比喻:这就像一个学生在SAT考试中拿了高分,但这个分数不代表他在现实生活中的实际水平。

02 Argon已入驻谷歌生产环境

与基准数据相比,更有说服力的是Argon已经融入谷歌真实的业务运营。

谷歌DeepMind的高管兼首席AI框架设计师科雷·卡夫克丘奥卢(Koray Kavukcuoglu)介绍,现已有数千位谷歌员工投入使用Argon,其应用覆盖了编程、工程优化、研究工作等众多方向。

其中,Argon在处理高难度工程问题时展现的能力最具代表性。量子计算部门的研究小组借助Argon来优化某个关键子例程的资源消耗,在只用了几分钟的时间里,就比已发表的对标方案提升了四十个百分点。

针对内存的优化,一个由Argon驱动的智能体对谷歌全体系统的性能数据做了分析,自主找出并执行了优化措施,上线以后已经释放了超过三百TiB的内存,估计最终节省规模能够到五百TiB至一PiB。

技术行业的分析人士@kimmonismus认为,最值得注意的地方在于,这些智能体已经开始在谷歌自身的基础结构中承担真实工作,涉及遥测数据分析、内存优化及代码移植等,而非只停留在概念展示层面。

AMP

代码库迁移是Argon应用落地的另一个主要项目。它正协助谷歌完成内部C/C++代码向Rust语言的转换,从核心库的数万行代码,到Fuchsia操作系统Zircon内核的八十多万行代码都在转换范围内。由于这些系统的关键作用,所有转换结果在部署之前必须通过自动化测试和人员的手动审核。

其中一个较为典型的例子是libgav1视频解码器。Argon运用三万二千多行安全的Rust代码来替代原来的SIMD实现,并通过编译器的自动向量优化,最终生成的内存安全解码器相较之前的Rust版本速度提升了两倍多,同时完全保证了视频输出的准确性。

在网络安全层面,谷歌针对Argon进行了专项防御能力训练,让它可以自主地识别、验证以及修补严重漏洞。对于经认可的防卫工作者和公司内部团队,谷歌会供应去掉网络防御限制的版本,以便充分释放其尖端级防卫能力。

云基础设施安全厂商Wiz已经在其「善意安全扫描」项目中使用了Argon。在早期验证的过程中,该模型找到了一个存在于全球医院医疗系统里的重大漏洞,涉及敏感个人数据的泄露,而现有的其他顶级模型都没能识别出这一问题。

03 定价低廉,但普通用户无缘

从Argon的定价计划来看,核心思路就是「便宜,但你一时半会儿买不到」。

早期优惠价为输入文本两美元、输出十美元每百万token,仅相当于GPT-6 Astra标价的二十分之一,约等于Claude Opus 5.5价格的一半。缓存的输入优惠幅度达九十五个百分点,折扣后仅零点一美元。根据Artificial Analysis的计算,打折后Argon单个智能指数任务的成本为一点九九美元,相当于GPT-6 Astra的百分之六十。优惠期结束后标价会与Opus 5.5一致,每项任务成本大概是Astra的百分之一百二十。

AI行业的观察者@NFT_Chen评论说,Gemini 4 Argon恰好落在最优点上。在优惠价的条件下,单任务成本只有Astra的百分之六十,DeepSWE拿到新纪录,AutomationBench居首位,错误率同水平最低,输出上限达到一百万tokens。在七个月的等待之后,谷歌总算把真正的尖端产品拿出来了。

AMP

在安全防护方面,谷歌列举了四大保护范围:抵御网络和CBRN的恶意利用、对抗提示注入、追踪不当行为、强化隔离防护。

Gray Swan间接提示注入评估中,Argon的被攻击得手率仅零点七个百分点,低于Claude Opus 5.5的百分之一和GPT-6 Astra的百分之八点五。谷歌还部署了一套对齐监察框架,实时监控Argon的思维过程与执行步骤,在必要时停止继续执行,同时明确强调在能力急速升级的此刻应保持推理的透明度。

04 谷歌能否重返舞台中心?

Argon的呈现,是谷歌对社会大众中「已然落伍」这一论断的集中反驳。

在已经过去的大半年内,谷歌在前沿模型领域的关注度下滑。Gemini 3系列在二零二五年十一月亮相,而后续的Gemini 3.5 Pro因多次延后被最终搁置。根据彭博情报分析师曼迪普·辛格(Mandeep Singh)的评估,开发这样一款模型的投入可能高达四亿美金。与此同时,OpenAI和Anthropic在快速进行版本更新,差距在不断加大。

公司内部的波动进一步强化了外界的忧虑。二零二六年八月,戴密斯·哈萨比斯(Demis Hassabis)从DeepMind首席执行官一职上退下来,升任Alphabet的主席和首席科学官;杰夫·迪恩(Jeff Dean)选择了离职创业;卡夫克丘奥卢被任命为新的最高管理者。这被看作是谷歌自二零二三年OpenAI进行的人事变动以来规模最大的AI领导班子调整。

传奇工程师杰夫·迪恩、诺奖得主约翰·江珀(John Jumper)、诺姆·沙齐尔(Noam Shazeer)等顶级学者也先后离职。

Creative Strategies的分析员马克斯·温巴赫表述,他之前对Gemini这一系列的整体印象并不乐观,但根据当下展现出来的效果,谷歌似乎总算交出了一份有角逐力的尖端产品,可能也化解了之前过度思考等困扰。

AMP

Argon的面世恰逢其时。在表面数据上,它交上了令人信服的成绩。然而要真的重回尖端竞争的舞台,单纯依靠基准分数是不足够的。

第一是现实中的易用性。基准测试的高分并不直接转换为生产系统的顺利运行,前端设计等方面的欠缺、模型体积庞大带来的推理消耗、以及「竞技分数优化」的倾向,这些都需要在实际的应用中加以确认。

谷歌CEO桑达尔·皮查伊(Sundar Pichai)在网络社交中指出,会尽快且以最安全的方式让Argon开放使用,「接下来还有很多新动作要推出,各位将见证我们的加速迭代。」

经历了七个月的沉寂,谷歌最终拿出了新时代的尖端产品。它能否真的改变现状,重新让谷歌回到AI竞争的第一线?答案也许就隐藏在接下来几个月的高速进化当中。


上一篇 2026/09/30 22:55
下一篇 2026/09/30 22:55

相关推荐

  • 伊朗代表团驳斥「逐客」传言:早已告知美国将离开

    美方声称国务卿鲁比奥要求伊朗代表团立即离美,伊朗方予以驳斥。伊朗常驻联合国代表团强调,该团根据9月17日就已通知美国的计划于28日离开纽约,指责美国在谈判无果后散布虚假信息。伊朗外长阿拉格齐已完成纽约行程返回德黑兰。

    2026/10/01
    00
  • 98分的国家,却活成了满分的警惕——安全感的隐形代价

    国家安全指数全球第一、评分达98.23%,但在漂亮数据背后,民众正用个人防卫弥补公共安全空缺。拒接来电、检查配料、紧盯定位……人们虽未遭伤害,却始终处于低烈度警觉中。真正的安全不仅要免于身体伤害,也应包括免于持续警惕的自由。

    2026/10/01
    00
  • 胡锡进国庆文章意外「露馅」,豆包提示语被直接转发,他这样回应

    国庆期间,资深媒体人胡锡进发表国庆散文,却意外将AI助手豆包的提示语一并发布。事后他澄清使用AI并非代笔,而是辅助口述转写和事实核查。此事引发业界对AI创作边界的深度思考。

    2026/10/01
    00
  • 北约”变天”?特朗普政府冷落多个主要盟友

    特朗普政府计划在下月举办的北约会议上排除英国、法国等主要盟友。欧洲外交官对此困惑,质疑美国是否偏袒特定国家。此举恐加剧北约分裂。特朗普曾批评北约为”单行道”,欧洲官员警告其言论已削弱联盟。

    2026/10/01
    00
  • 从这份行政复议文书看,权力如何变相”架空”法律

    新宁县政府以仅限民事个案的司法答复作为限制公民代理权的依据,暴露权力滥用问题。该做法违反法律位阶原则,创设非法门槛,违背《行政复议法》立法初衷。反映基层某些机关以权压法、懒政怠政现象,让法治建设沦为形式主义。

    2026/10/01
    00

发表回复

登录后才能评论