
深夜时分,DeepSeek官方网站的API界面迎来重要变更——模型库里的V4-Pro预览版被正式版「DeepSeek-V4-Pro-0813」所替代。巧合的是,同样的夜晚,源自马斯克麾下的SpaceX AI也推出了Grok最新代号4.6。
这两个高效能、低成本的AI方案于同一夜晚正式亮相,两位科技巨擘的正面交手,反倒让OpenAI和Anthropic面临前所未有的挑战。
官方内部泄露出的一份对标评测数据揭示了V4 Pro的真实水位——它在多个智能体基准测试上交出了令人瞩目的答卷。尤其值得关注的是Terminal Bench 2.1这项指标,该基准旨在评估AI处理现实终端环境下复杂作业的能力。V4 Pro在这里收获了87.9分的好成绩,与全球顶尖的Anthropic Fable 5之间仅存0.1分的微弱差距。相形之下,从预览版的72.1分跃至此,短短三个月时间就完成了15.8分的拔升。
Cybergym这项侧重AI安全防护的基准上,V4 Pro凭借83.3分的成绩超越了Fable 5的83.1分;到了考察工作流处理能力的AutomationBench评测中,31.8分对29.1分的对比同样显示出技术优势。
在软件工程领域的DeepSWE测试上,进步更是惊人——从测试版的12.8分直接攀升到62.7分,涨幅将近五倍,并且远远甩开了Anthropic上一代旗舰产品Opus 4.8的58.0分。此外,正式版本的V4 Pro还支持长达百万Token的上下文窗口,最多能一口气生成384K的Token输出,同时兼容OpenAI与Anthropic的API调用规范,开发者基本不用动代码就能切换平台。
要想理解此次版本升级的真正意义,需要抓住智能体这个关键词。Terminal Bench与DeepSWE等基准考查的核心问题很直白——现在的AI到底有没有本事真正去「干活」。这涉及到工具调用、多层级流程执行、源代码编写与修改、贯穿整条链路的持续操作直至输出成果等能力。这些正是大模型摆脱聊天助手身份、晋升为生产级工具的决定性槛位。
就在V4 Pro对外宣布前不久,SpaceX AI旗下的Grok 4.6也闪亮登场,其战斗的对象同样指向长周期智能体工作流。在专为现实知识劳动设计的GDPVal-AA v2评估体系中,Grok 4.6以1753 Elo的积分名列前茅,进而压倒Fable 5的1741以及GPT-5.6 Sol Max的1728。两个新生代模型在此时此刻形成了一种意外的默契,都将矛头对准了同一个命题:怎样才能让AI在延长的任务周期中可靠地生产出有实用价值的结果。
但让人震惊的是它们在价格上的天壤之别。以每百万Token的输出费用来看,Fable 5要价50美元,GPT-5.6 Sol Max在30美元,Grok 4.6设定在6美元,而DeepSeek V4 Pro竟只需0.87美元,这意味着它的标价仅为Fable 5的1/57。换句话说,性能上仅差0.1分的两款模型,却存在整整五十七倍的费用落差。
另值得关注的是,DeepSeek在此轮发布中还推进了其智能体工具「Harness」的建设。据报道,Harness项目在今年5月正式在公司内部启动,项目由崔添翼主导负责。
崔添翼是浙江大学计算机专业的毕业生,在知名量化交易公司Jane Street供职长达九个年头,于本年3月才正式加盟DeepSeek。与此相应,「DeepSeek Harness团队」这一公众号账号也于7月初的6日完成了注册。到了8月1日这天,崔添翼还向国际社区发出了广泛邀约,招募对Harness项目感兴趣的早期测试者。
就在技术指标节节攀升的时候,关于提价的消息也随之传来。8月6日那天,DeepSeek在其公开平台上发布了一份通知——公司打算在不久后对API服务的整体定价进行向上调整,并且涨幅不会太小。这一次有所不同,它是DeepSeek首度对全局定价的涨幅做出预告,过往的调价往往仅限于高流量时段的临时性措施。
回溯DeepSeek的价格变动轨迹不难发现:V4推出于4月,V4 Pro的API首发时给出了2.5折的促销价;到了5月的最后一天,这轮优惠宣告结束,随之而来的是一个永久性的价格下调,直接将费用设定为原价的1/4;到了6月29日,又推行了峰谷分时计费机制。这样来看,从宣布永久降价到发出涨价预告,整个周期还不足两个月。
若是简单地把涨价解读为「成本压力」,未免对DeepSeek的真实意图理解有偏。回顾不久前的6月16日,DeepSeek完成了公司历史上首笔来自外部投资者的融资,融资规模突破500亿元人民币大关,融资后的公司估值也升破3500亿元,这个数字创造了中国AI领域单轮融资的新高度。
最近的报道指出,DeepSeek正在筹划第二轮融资活动,目标融资金额也在500亿元左右,融资前的估值拟定在5000亿元级别。摩根士丹利在8月9日发布的最新研究文章中,列举了三方面的可能驱动因素:其一,V4模型的需求十分火热,这为提价奠定了基础;其二,企业需要在争夺市场份额和保护利润率两者间求得平衡点,以便持续加大对新一代模型的投入;其三,如果选择更多地采用国产处理器芯片,这可能导致推理的成本有所抬升。
这份报告的核心观点认为,真正决定大模型竞争胜负的终极要素是其自身的智能水平,而不是价格的高低。
放大视角,DeepSeek的提价举措并非特例。摩根士丹利曾对包括字节跳动、阿里巴巴、百度、腾讯、智谱、月之暗面、MiniMax和DeepSeek在内的国内头部大模型厂商进行了统计分析。数据表明,中国大模型生态中API输出费用的行业均价呈现出回升势头——从2025年Q1的约12.2元每百万Token,上升到了2026年Q2的21.9元每百万Token。具体看各家的表现:智谱相比去年年底的水位,API定价在半年内累计上调了约83%,可是其调用总量却增加了4倍还要多。腾讯公司在3月和4月这两个月内先后发动了两波定价调整,某些产品的价格涨幅甚至达到了463%。
俯视全景的AI产业生态,计算资源的供需失衡、采购芯片的成本高企、运维管理的各项支出居高不下,这些都让单纯靠降价来扩大规模的老路变得行不通了。如今各大头部选手都已放弃了将价格作为竞争利器的思路,这也就意味着行业进入了新的阶段,竞争的焦点转向了另一个维度:倒不是谁的报价更低,而是谁有真本事去解决用户的实际问题。
这两个高效能、低成本的AI方案于同一夜晚正式亮相,两位科技巨擘的正面交手,反倒让OpenAI和Anthropic面临前所未有的挑战。
官方内部泄露出的一份对标评测数据揭示了V4 Pro的真实水位——它在多个智能体基准测试上交出了令人瞩目的答卷。尤其值得关注的是Terminal Bench 2.1这项指标,该基准旨在评估AI处理现实终端环境下复杂作业的能力。V4 Pro在这里收获了87.9分的好成绩,与全球顶尖的Anthropic Fable 5之间仅存0.1分的微弱差距。相形之下,从预览版的72.1分跃至此,短短三个月时间就完成了15.8分的拔升。
Cybergym这项侧重AI安全防护的基准上,V4 Pro凭借83.3分的成绩超越了Fable 5的83.1分;到了考察工作流处理能力的AutomationBench评测中,31.8分对29.1分的对比同样显示出技术优势。
在软件工程领域的DeepSWE测试上,进步更是惊人——从测试版的12.8分直接攀升到62.7分,涨幅将近五倍,并且远远甩开了Anthropic上一代旗舰产品Opus 4.8的58.0分。此外,正式版本的V4 Pro还支持长达百万Token的上下文窗口,最多能一口气生成384K的Token输出,同时兼容OpenAI与Anthropic的API调用规范,开发者基本不用动代码就能切换平台。
要想理解此次版本升级的真正意义,需要抓住智能体这个关键词。Terminal Bench与DeepSWE等基准考查的核心问题很直白——现在的AI到底有没有本事真正去「干活」。这涉及到工具调用、多层级流程执行、源代码编写与修改、贯穿整条链路的持续操作直至输出成果等能力。这些正是大模型摆脱聊天助手身份、晋升为生产级工具的决定性槛位。
就在V4 Pro对外宣布前不久,SpaceX AI旗下的Grok 4.6也闪亮登场,其战斗的对象同样指向长周期智能体工作流。在专为现实知识劳动设计的GDPVal-AA v2评估体系中,Grok 4.6以1753 Elo的积分名列前茅,进而压倒Fable 5的1741以及GPT-5.6 Sol Max的1728。两个新生代模型在此时此刻形成了一种意外的默契,都将矛头对准了同一个命题:怎样才能让AI在延长的任务周期中可靠地生产出有实用价值的结果。
但让人震惊的是它们在价格上的天壤之别。以每百万Token的输出费用来看,Fable 5要价50美元,GPT-5.6 Sol Max在30美元,Grok 4.6设定在6美元,而DeepSeek V4 Pro竟只需0.87美元,这意味着它的标价仅为Fable 5的1/57。换句话说,性能上仅差0.1分的两款模型,却存在整整五十七倍的费用落差。
另值得关注的是,DeepSeek在此轮发布中还推进了其智能体工具「Harness」的建设。据报道,Harness项目在今年5月正式在公司内部启动,项目由崔添翼主导负责。
崔添翼是浙江大学计算机专业的毕业生,在知名量化交易公司Jane Street供职长达九个年头,于本年3月才正式加盟DeepSeek。与此相应,「DeepSeek Harness团队」这一公众号账号也于7月初的6日完成了注册。到了8月1日这天,崔添翼还向国际社区发出了广泛邀约,招募对Harness项目感兴趣的早期测试者。
就在技术指标节节攀升的时候,关于提价的消息也随之传来。8月6日那天,DeepSeek在其公开平台上发布了一份通知——公司打算在不久后对API服务的整体定价进行向上调整,并且涨幅不会太小。这一次有所不同,它是DeepSeek首度对全局定价的涨幅做出预告,过往的调价往往仅限于高流量时段的临时性措施。
回溯DeepSeek的价格变动轨迹不难发现:V4推出于4月,V4 Pro的API首发时给出了2.5折的促销价;到了5月的最后一天,这轮优惠宣告结束,随之而来的是一个永久性的价格下调,直接将费用设定为原价的1/4;到了6月29日,又推行了峰谷分时计费机制。这样来看,从宣布永久降价到发出涨价预告,整个周期还不足两个月。
若是简单地把涨价解读为「成本压力」,未免对DeepSeek的真实意图理解有偏。回顾不久前的6月16日,DeepSeek完成了公司历史上首笔来自外部投资者的融资,融资规模突破500亿元人民币大关,融资后的公司估值也升破3500亿元,这个数字创造了中国AI领域单轮融资的新高度。
最近的报道指出,DeepSeek正在筹划第二轮融资活动,目标融资金额也在500亿元左右,融资前的估值拟定在5000亿元级别。摩根士丹利在8月9日发布的最新研究文章中,列举了三方面的可能驱动因素:其一,V4模型的需求十分火热,这为提价奠定了基础;其二,企业需要在争夺市场份额和保护利润率两者间求得平衡点,以便持续加大对新一代模型的投入;其三,如果选择更多地采用国产处理器芯片,这可能导致推理的成本有所抬升。
这份报告的核心观点认为,真正决定大模型竞争胜负的终极要素是其自身的智能水平,而不是价格的高低。
放大视角,DeepSeek的提价举措并非特例。摩根士丹利曾对包括字节跳动、阿里巴巴、百度、腾讯、智谱、月之暗面、MiniMax和DeepSeek在内的国内头部大模型厂商进行了统计分析。数据表明,中国大模型生态中API输出费用的行业均价呈现出回升势头——从2025年Q1的约12.2元每百万Token,上升到了2026年Q2的21.9元每百万Token。具体看各家的表现:智谱相比去年年底的水位,API定价在半年内累计上调了约83%,可是其调用总量却增加了4倍还要多。腾讯公司在3月和4月这两个月内先后发动了两波定价调整,某些产品的价格涨幅甚至达到了463%。
俯视全景的AI产业生态,计算资源的供需失衡、采购芯片的成本高企、运维管理的各项支出居高不下,这些都让单纯靠降价来扩大规模的老路变得行不通了。如今各大头部选手都已放弃了将价格作为竞争利器的思路,这也就意味着行业进入了新的阶段,竞争的焦点转向了另一个维度:倒不是谁的报价更低,而是谁有真本事去解决用户的实际问题。