深夜突袭!DeepSeek最强模型正式上线,性能逼近业界第一

无声无息间,DeepSeek V4 Pro的正式版本悄然发布。

在北京时间8月12日深夜,DeepSeek官网的API接口文档被静默更新,之前的V4-Pro预览版已被DeepSeek-V4-Pro-0813所取代。官方在「模型价格」页面已明确将deepseek-v4-pro的对应版本标注为DeepSeek-V4-Pro-0813,而API的服务费用目前还没有相应提升。

这表明DeepSeek V4 Pro的正式版已可能通过API灰度发布或直接提供给用户。根据多家科技媒体披露的DeepSeek官方讨论组数据,此新版本在众多智能体(Agent)评测项目上已接近Anthropic的前沿产品Claude Fable 5的水准,某些测试项目的成绩甚至领先Fable 5;与之前的V4 Pro预览版本相比,性能获得了显著跃升。

DeepSeek新模型正式版深夜发布 实力逼近榜一

巧合的是,DeepSeek的这一动作几乎与埃隆·马斯克旗下的SpaceX AI推出Grok 4.6同步进行。这两款以成本效益见长的产品在同一窗口期内齐齐向最先进模型的阵营发起冲击,使得AI大模型的价格与性能竞争重新升温。

API文档悄然换版,官方仍未发布正式更新日志

观察DeepSeek官网所发生的变化,V4 Pro的正式版发布行为堪称极为低调。

在DeepSeek API官方的「模型价格」页面上,当前显示deepseek-v4-pro所对应的版本号为DeepSeek-V4-Pro-0813;该模型能够支持百万级别的上下文长度、最达384K的输出容量,并具备JSON Output、Tool Calls、Responses API、Anthropic API以及FIM等多项功能。

AMP

官方在「首次调用API」的指南页面同样已将可用的模型列表更新为deepseek-v4-pro,并提供了通过思考模式启动此模型的调用示例代码。

AMP

然而令人注目的是,DeepSeek至今并未发表V4-Pro-0813对应的官方更新说明。

在DeepSeek的变更记录页面中,最新的记录仍然停留在7月31日关于V4-Flash正式版的内容。当时的通告明确指出,该日期的升级仅涉及V4-Flash API层面,V4-Pro的API接口及应用程序/Web版本的模型保持不变,并表示「DeepSeek-V4-Pro正式版将尽快推出」。到现在为止,该页面仍然没有关于V4-Pro-0813正式上线的任何声明。

鉴于这一变化最初是通过API接口文档和用户的实际调用发现的,而并非官方的正式公告,所以从严格的定义出发,目前更准确的描述应该是DeepSeek V4 Pro的正式版已经在API层面上线,而不是DeepSeek正式推出了完整的V4 Pro产品声明。

多项智能体测试逼近Fable 5,预览版到正式版提升明显

真正吸引市场目光的,乃是当下在AI社群中广泛流传的性能对标数据。

根据媒体引用的来自DeepSeek官方交流平台的评测数据,DeepSeek V4 Pro的正式版本(DeepSeek-V4-Pro-0813)在许多评估项目中已逼近Fable 5的成绩,较之前面世的V4 Pro预览版,其能力获得了突破性的增强。

其中最值一提的便是与智能体相关的测试项目。

有别于常规大模型着重于知识问卷与数学运算的考察,智能体的评测更加贴近AI在「实际工作」层面的表现,涵盖对外部工具的调度能力、多步骤任务的完成、程序代码的撰写与调试、以及对长期复杂项目的推进等方面。

这正是DeepSeek V4系列自推出之日起就集中投入的重点领地。

早在4月推介V4预览版时,DeepSeek就突出强调,V4 Pro在Agentic Coding的评测上达成了当时开源阵营的领先成绩,并对Claude Code、OpenClaw、OpenCode、CodeBuddy等多个主流Agent应用进行了深度适配与能力调优。V4 Pro还能够提供百万级上下文支持与思考模式,通过reasoning_effort参数可灵活调控思考的深度。

到了7月31日推出V4 Flash的正式版本,DeepSeek进一步展示了其在智能体能力上的跨越式发展,具体表现为Terminal Bench 2.1成绩达82.7分、NL2Repo成绩达54.2分、DeepSWE成绩达54.4分、Toolathlon verified成绩达70.3分等,并确切表明正式版的智能体能力大幅领先V4-Pro-Preview版本。

眼下V4 Pro的正式版继续拉近与Fable 5的差距,这说明DeepSeek在Agent领域的前期积淀正逐步通过后续训练和工程方案的改进而转化为真实的任务处理能力。

但是,鉴于眼下传播的新版本评测数据主要出自官方讨论区和社群渠道,DeepSeek还未在官方更新记录中披露V4-Pro-0813的完整测试数据,故而这些具体数值应当被列为未经官方正式发布的信息,不可与DeepSeek最终正式公开的测试结果混为一谈。

价格暂未上调,但官网已经预告近期将大幅涨价

定价政策则成为此番V4 Pro正式版发布的又一个核心焦点。

据现下DeepSeek官方公布的API计费表,V4 Pro单位为百万Token的计费标准为:缓存命中时的输入费用0.003625美元、缓存失效时的输入费用0.435美元、输出费用0.87美元;以之前的人民币换算标准来看,这大约相当于输入3元、输出6元每百万Token。

这说明新的V4 Pro版本在性能增强的情况下,暂时并未跟随提高收费标准。

此前DeepSeek曾将V4 Pro API的收费从初始报价持久下降到原价的25%,将输入缓存命中、输入缓存未命中及输出的费用分别压低至0.025元、3元及6元每百万Token。

但值得留意的是,这一次官网其实留下了一条值得关注的布局。

DeepSeek在价格页面的公示中明白地表述:「我们计划在近期内提高DeepSeek API的整体服务定价」,且「涨幅预期较大」,具体的新价格方案有待官方正式发布。

由此可见,V4 Pro正式版当下「性能飙升、费率不涨」的局面,很可能难以维系太长时间。

从这个角度看,此番更新俨然成为了一场「涨价前夜」的性能升级与产品版本切换:DeepSeek先行将新型号模型向API使用者推出,其后再依据算力产出、使用频度及生意需求来动态调整收费。

一边是DeepSeek,一边是Grok:前沿模型竞争突然「撞车」

倘若没有Grok 4.6的出现,DeepSeek V4 Pro此番出其不意的上线本已足够吸引商场的聚焦。

然而事情的巧合实在非同寻常。

在DeepSeek V4 Pro-0813无声上线的仅仅数小时之前,SpaceX AI才刚完成Grok 4.6的发布。

在Artificial Analysis发布的GDPVal-AA v2评估体系(该体系针对现实场景中的专业知识工作对AI智能体进行考量)中,Grok 4.6拿到了1753 Elo的分数并排名榜首,成绩超越了OpenAI的最新型号GPT-5.6 Sol Max的1728分,也领先Anthropic旗下Claude Fable 5的1741分。SpaceX AI同样宣布,Grok 4.6在Artificial Analysis Intelligence Index的评测中收获61分的成绩,与GPT-5.6 Sol Max打成平手。

更为关键的是其定价策略:Grok 4.6的API收费标准为输入Token百万级2美元、输出6美元,SpaceX AI将其明确定位为竞争对手前沿模型价格的50%。

眼下DeepSeek V4 Pro-0813又在众多评测上接近Fable 5水准,并且当前仍然维系着百万Token输入3元、输出6元的价格。

这两款产品在几近相同的时间内向业界传递了相似的讯息:前沿型号之间的性能差异正在收窄,而成本方面的竞争优势正演变成崭新的赛场武器。

对于OpenAI、Anthropic等既有前沿模型供应商而言,所承受的压力已远非单纯的「基准分数之争」。

从前AI模型竞争多聚焦于「哪个最强」的话题,而随着DeepSeek和Grok不断向最高端靠拢,市场上悄然萌生了新的对垒逻辑:假设能力已然相差无几,开发者缘何还要为性价比更低的型号付出数倍代价?

从「便宜」到「能干活」,DeepSeek重新冲击智能体市场

此轮DeepSeek V4 Pro的升级,其价值可能远超一次常规性的版本更替。

早在今年4月V4面世时,DeepSeek就已把关注重心从传统对话模型转移至Agent领域,并将百万级Token的上下文跨度、代码编程与工具调用等能力作为主打亮点。

其后V4 Flash的正式版随之而至,又重点加强了Code Agent与Search Agent等功能维度。DeepSeek甚至在7月31日的声明中直言,V4 Flash正式版在Agent能力上得到了质的飞跃,并在不少Agent类的基准测试项目中稳超V4-Pro-Preview。

如今V4 Pro的正式版本继续朝着Fable 5等业界顶尖闭源产品靠近,这足以说明DeepSeek的竞争指向已然超越了「推出更廉价的通用型号」的初心,而是冀图在AI从交互聊天向真实任务执行蜕变的阶段中,占据Agent类基础模型的阵地。

而这与Grok 4.6本轮升级的核心重点不谋而合。

Grok 4.6同样把长周期运行的智能体、复杂程序编写与知识类工作作为发力重点,并在Cursor等开发人员常用工具中直接集成提供服务。

由此可见,DeepSeek V4 Pro-0813与Grok 4.6的「同日交会」在某种意义上也折映出AI产业竞争已然步入崭新阶段:

前沿型号间的对抗已从单纯的参数规模与交互能力的较劲,演进为智能体执行水准、Token经济账及开发者生态的多维竞赛。

而这场角逐,想必才是序幕而已。


上一篇 2026/08/12 20:26
下一篇 2026/08/12 21:26

相关推荐

  • 电影投资「套路」成灾:票房爆红为何投资者分不到钱

    多部票房超30亿元热门电影被当融资工具,投资人迟迟无法获得承诺分红。调查发现中引文化以掌握电影份额为名兜售收益权,融资数千万元。多部影片上映后,公司却不断推脱拒付。更震惊的是,出品方公开否认合作,法院已认定涉嫌刑事犯罪。

    2026/09/29
    00
  • 十年温暖陪伴,她为「问题少年」点燃希望之光

    谢岚在上海虹口区一所专门学校任教10年,通过「无错教室」「教育戏剧」等创新课程,与被标签化的孩子们建立相互理解与尊重的关系。这些看似「不可教」的学生,在温暖环境中逐渐认识自我、绽放光彩,启示我们教育的本质在于看见、理解和陪伴。

    2026/09/29
    00
  • 奥特曼回应 IPO 质疑:OpenAI 会「急不得,也等不得」

    OpenAI CEO 奥特曼日前表示,公司在做出安全决策之前不会上市,但也不会过度延迟。这家估值 8520 亿美元的公司已将 IPO 计划推至明年,目前正进行私募融资,拟融资 300 亿美元或以上。奥特曼强调,OpenAI 需要在适应 AI 技术新阶段的同时,确保安全可控,避免上市后的高压制约。此外,法律组织 LASST 对 OpenAI 提起首例诉讼,要求其采取更严格的 AI 开发规范。

    2026/09/29
    00
  • 为什么教体局敢对记者说「关你屁事」?

    一名17岁女孩开学首日在校园坠亡,记者采访时遭教体局一句粗鲁回怼。这背后暴露的不仅是工作人员素质缺失,更反映出权力对监督的抵触、制度层面的傲慢。媒体揭露隐患本是防止悲剧重演的必要条件,为何教育主管部门却视之为冒犯?

    2026/09/29
    00
  • 「监控之下无言」——谁来护航法律人的发声权?

    珠海律协对律师的监控举措引发深思。无形的监视在行业内滋生恐惧,使律师自觉约束言行,削弱其代言权。这种越权行为损伤的不仅是律师群体,更威胁到普通百姓的维权途径。当法律人畏首畏尾,社会对法治的信心必将动摇。权力越界、边界模糊是根本症结。

    2026/09/29
    00