GPT-5.5全面解析:更大规模、更高智能,AI第一次帮自己优化了基础设施

作者声明:该图片由AI生成

一文读懂GPT-5.5:更大、更贵、更智能

北京时间4月24日,OpenAI正式推出新一代旗舰模型GPT-5.5,官方将其定位为”专为真实工作场景打造的全新智能层级”,并视其为迈向全新计算工作方式的重要里程碑。

此次发布有两个核心看点:

其一,效率上的突破:在相同延迟条件下,模型规模更大,但速度并未下降。GPT-5.5的上下文窗口达到100万Token,它并非GPT-5.4的简单升级,而是在维持同等延迟的前提下实现了更高智能。

其二,GPT-5.5在训练过程中直接参与了自身推理基础设施的优化——换句话说,AI史上首次学会了给自己调参数。

在考验复杂命令行工作流的Terminal-Bench 2.0测试中,GPT-5.5得分82.7%,比Claude Opus 4.7的69.4%高出逾13个百分点;在测试AI独立操作真实计算机的OSWorld-Verified中,成功率达78.7%,超越人类基线;在横跨44个职业领域知识工作的GDPval测试中,84.9%的任务达到或超过行业专家水准。

不过,GPT-5.5的定价也明显提升。

API定价为每百万Token输入5美元、输出30美元,是GPT-5.4(输入2.50美元、输出15美元)的两倍,但官方强调,GPT-5.5完成同等任务所需的Token数量大幅减少,综合使用成本未必会显著上升。GPT-5.5 Pro API定价则为每百万Token输入30美元、输出180美元。批量处理和弹性定价享受半价优惠,优先处理为标准价格的2.5倍。

AMP

在ChatGPT平台上,GPT-5.5以”GPT-5.5 Thinking”的形式上线,并将逐步取代此前的版本。

一个新增的小设计是:模型在开始思考前会先给出一段思路概述,用户可以在执行过程中随时插话调整方向。

如果用一句话概括GPT-5.5的意义:过去的模型是能力的集合,而GPT-5.5更像一个会规划、会自查、能持续推进的工作系统。

01 84.9%的任务,达到专业人士水准

AMP

GPT-5.5与各竞品在Terminal-Bench 2.0、GDPval、OSWorld-Verified等核心基准上的比较

先看模型在真实职业场景中的表现。OpenAI采用了”GDPval”基准,要求模型完成完整的职业任务序列,覆盖财务建模、法律分析、数据科学报告、运营规划等44个职业场景。

结果:GPT-5.5在84.9%的任务中达到或超过行业专业人士水平。对比来看,GPT-5.4为83.0%,Claude Opus 4.7为80.3%,Gemini 3.1 Pro仅有67.3%。

这种领先不仅体现在总分上。电子表格建模任务中,GPT-5.5内测得分88.5%;投资银行级别的建模任务同样领先前代。早期测试者的普遍反馈是:GPT-5.5 Pro的回答在全面性、逻辑性和实用性上相比GPT-5.4 Pro有明显提升,商业、法律、教育和数据科学领域尤为突出。

光看数字容易麻木,OpenAI这次干脆掀开自家工位让你看。

公司内部超过85%的员工每周都在使用Codex,覆盖财务、传播、市场、产品、数据科学等多个部门。传播团队借此分析了六个月的演讲邀约数据,搭建起一套自动化分级流程;财务团队审阅了24,771份K-1税务表格共71,637页,比往年提前两周完工;市场拓展团队依托自动化周报,每人每周节省5至10小时。

这已不再是实验室里的演示,而是日常工作的一部分。

02 当前最强自主编程模型

OpenAI称,GPT-5.5目前是其最强的自主编程模型。

在Terminal-Bench 2.0(考察复杂命令行工作流的规划、迭代与工具协调能力)中,GPT-5.5得分82.7%,比GPT-5.4的75.1%提升近8个百分点,且Token消耗更低。在SWE-Bench Pro(评估一次性解决真实GitHub问题的能力)上,GPT-5.5得分58.6%。在内部Expert-SWE评测(针对长周期编程任务,中位完成时间约20小时)中,GPT-5.5同样超越GPT-5.4。

AMP

Terminal-Bench 2.0与Expert-SWE散点图

由GPT-5.5驱动的Codex,已能从一句话的提示词出发,独立完成从代码生成、功能测试到视觉调试的完整开发流程。

OpenAI官方展示的案例中,一款太空任务应用基于NASA真实轨道数据构建,支持3D交互操控,轨道力学模拟达到真实物理精度;地震追踪器接入实时数据源并完成可视化,展示了模型调用外部API、处理动态数据并实时渲染的完整能力。

AMP

AMP

Every创始人兼CEO Dan Shipper分享了一段亲身经历:他曾遇到一个上线后的bug,自己花了好几天没能解决,最终只得请公司最强的工程师出手,重写了部分系统。GPT-5.5发布后,他将模型放回bug尚未修复的状态,测试它能否自主推导出与工程师一致的解决方案。GPT-5.4做不到,GPT-5.5做到了。他的评价是:”这是我用过的第一个真正具备概念清晰度的编程模型”。

AMP

一位英伟达工程师的评价更为直白:”失去GPT-5.5的访问权限,就像截肢一样。”

AMP

Cursor联合创始人兼CEO Michael Truell补充道:GPT-5.5比GPT-5.4更聪明、更有韧性,在复杂长任务中能坚持更久而不提前中止——而这恰恰是工程工作最需要的特质。

03 知识工作:AI第一次真正能”用”电脑

在OSWorld-Verified测试中(考察模型独立操控真实计算机环境的能力),GPT-5.5成功率78.7%,高于GPT-5.4的75.0%,也优于Claude Opus 4.7的78.0%。

这不是截图分析,而是真实的屏幕操控:看懂界面、点击、输入、在多个工具间切换,直到任务完成。GPT-5.5让人第一次感受到,AI可以真正与用户共用同一台电脑。

AMP

财务建模演示视频

在电信客服工作流测试Tau2-bench上,GPT-5.5在无提示词调优情况下准确率高达98.0%,而GPT-5.4仅为92.8%。

这意味着模型对任务意图的理解已足够深入,无需精心设计提示词,便能应对复杂的多步骤对话流程。

在工具搜索能力上,GPT-5.5在BrowseComp测试中得分84.4%,GPT-5.5 Pro更达90.1%,说明在需要跨多个信息来源综合推理的研究类任务中,模型展现出相当强的持续检索与信息整合能力。

04 科学研究:协助发现数学新证明

在此次发布中,GPT-5.5在科研领域的表现,可能是最出人意料的部分。

以往谈到AI做科研,更多是辅助角色——查文献、写代码、整理数据。但这一次,它的参与明显前移,开始介入更核心的环节:复杂推理,乃至知识发现本身。

在GeneBench(遗传学和定量生物学多阶段数据分析基准)上,GPT-5.5得分25.0%,GPT-5.4为19.0%。这类任务通常需要科学专家耗费数天,要求模型在几乎无监督的情况下推理可能含有错误的数据、应对潜在的混杂因素,并正确运用现代统计方法。

AMP

从图表曲线可以看出,随着输出Token数量的增加,GPT-5.5的得分提升始终领先GPT-5.4,且在约15,000 Token处出现明显分化——这意味着面对需要深度推理的长任务,GPT-5.5的优势会随复杂度的提升而进一步放大。

在BixBench(真实世界生物信息学与数据分析基准)上,GPT-5.5以80.5%的得分领先GPT-5.4的74.0%,在已公布得分的模型中位居前列。

最引人关注的是一个具体案例:搭载自定义工具框架的GPT-5.5内部版本,协助发现了一项关于拉姆齐数的新数学证明,并在形式化证明工具Lean中得到验证。拉姆齐数是组合数学的核心研究对象,相关成果极为罕见,技术门槛极高。这不只是AI提供代码或解释,而是真正贡献了一个数学论证。

在实际应用层面,Jackson实验室免疫学教授Derya Unutmaz用GPT-5.5 Pro分析了一个包含62个样本、近28,000个基因的基因表达数据集,生成了详细研究报告,提炼出关键发现和研究方向——他表示这项工作通常需要团队耗费数月。

波兹南亚当·密茨凯维奇大学数学系助理教授Bartosz Naskręcki,仅凭一句提示词,借助Codex中的GPT-5.5,在11分钟内构建出一款代数几何应用,可视化两个二次曲面的交线并将所得曲线转化为魏尔斯特拉斯模型,右侧实时显示的方程系数可直接用于后续数学研究。从提示词到可运行的研究工具,全程由模型独立完成。

AMP

Bartosz Naskręcki教授构建的代数几何应用截图——二次曲面相交可视化与魏尔斯特拉斯方程实时计算界面

Axiom Bio联合创始人Brandon White的评价颇为直接:”如果OpenAI保持这一势头,年底前药物发现的基础将会发生根本性改变。”

05 推理效率:AI第一次帮自己优化了基础设施

这次发布中有一个容易被忽略的细节,却可能是技术层面最值得关注的进展。

GPT-5.5是一个规模更大、能力更强的模型,但在实际服务中的单Token延迟与GPT-5.4持平。为了在更强能力下维持同等延迟,OpenAI将推理系统整体重新设计——而Codex和GPT-5.5本身也直接参与了这一优化过程。

从Artificial Analysis智能指数图可以直观看出这一点:横轴是输出Token总量(对数刻度),纵轴是综合智能得分。GPT-5.5的曲线不仅在得分上全面领先GPT-5.4、Claude Opus 4.7和Gemini 3.1 Pro Preview,更关键的是,它在Token消耗较少的区间就已经达到其他模型需要消耗更多Token才能达到的得分水平——更强的能力,更低的成本,这正是”效率提升”的直观体现。

AMP

Artificial Analysis智能指数折线图

具体来说,团队面临的问题是负载均衡:此前将请求拆分为固定数量的块来均衡GPU工作,但静态分块对所有流量形态并非最优。Codex分析了数周的生产流量数据,编写了自定义启发式算法,将Token生成速度提升逾20%。

GPT-5.5与NVIDIA GB200和GB300 NVL72系统协同设计、协同训练和协同部署。换句话说,这一代模型参与优化了运行自身的推理架构——这不是比喻,而是字面意义上的”AI改进了自己运行的系统”。

06 网络安全:能力提升,管控同步收紧

GPT-5.5在网络安全能力上有明确提升。在CyberGym测试中,GPT-5.5得分81.8%,GPT-5.4为79.0%,Claude Opus 4.7为73.1%。在内部”夺旗”(CTF)挑战任务中,GPT-5.5得分88.1%,GPT-5.4为83.7%。

AMP

CyberGym柱状图与CTF挑战任务散点图

OpenAI将GPT-5.5的网络安全和生物/化学能力评级定为应急准备框架下的”高”级,尚未达到”关键”级,但相比前代有明确提升。与此同时,官方也坦承,新部署的更严格风险分类器”部分用户最初可能会觉得有些不便”,并将持续进行调整。

为平衡防御需求与访问限制,OpenAI推出了”网络安全可信访问”计划:符合条件的安全研究人员和关键基础设施防御者可申请更宽松的访问权限,以更少摩擦使用高级网络安全功能。

背后的逻辑是:网络安全乃至生物相关的能力,技术扩散几乎是不可逆的趋势。与其试图彻底封堵所有人使用,不如换一种思路——让真正从事防御工作的人,优先用上最先进的工具。核心不是”要不要开放”,而是”先给谁用”。

上一篇 2026/04/24 01:45
下一篇 2026/04/24 01:45

相关推荐

  • 白宫握手间 | 习近平阐明立场,三大议题定格中美未来

    9月下旬,中国国家主席赴美白宫与特朗普总统进行会晤。这次在椭圆形办公室的对话涉及三大战略议题:东亚地缘格局、中美关系发展、中东地区稳定。中方阐明了台湾问题的原则底线,强调双方需将战略愿景转化为实际行动,支持美伊重归对话框架。

    2026/09/25
    00
  • 特朗普白宫独家首秀:新停机坪背后的故事和那句「评价」

    习近平9月24日访问白宫与特朗普会晤,随后参观了白宫南草坪新建的花岗岩直升机停机坪及「海军陆战队一号」座驾。特朗普向媒体评价习近平「精通石材」的言论引发关注,习近平则以沉默和平静表情作出回应。

    2026/09/25
    00
  • 「科技大佬云集白宫」特习会晚宴名单曝光,硅谷巨头齐聚迎习主席

    本周四特朗普在白宫举办盛宴款待习近平,美国科技业精英云集参加。预计包括马斯克、贝佐斯、库克等硅谷领袖亮相。然而中国企业界同行构成未定,虽然比亚迪、小米等商业巨头被纳入考虑,但习主席抵达时并无企业高管随行。有报道称数名中国高管已自费赴美等候邀请。此举与特朗普5月访华时美方派遣庞大商业团队随行的情景形成对比。

    2026/09/25
    00
  • 揭秘红毯对话:唇语专家破译两位第一夫人的谈话内容

    美中元首会晤期间,唇语专家解读彭丽媛与梅兰妮亚在红毯上的对话。两位第一夫人聊起拜伦的身高,梅兰妮亚邀请参加次日活动并暗示准备惊喜,川普强调两国领导人关系独特。

    2026/09/25
    00
  • 「白宫对话记」习近平与特朗普两小时会晤实录

    中美领导人在白宫椭圆形办公室成功会晤,会议历时两小时。习近平在特朗普亲自送别下乘车离开白宫,两国领导人将在随后国宴再次聚首,科技业及AI领域代表人士也将出席。

    2026/09/25
    00