OpenAI正式发布了目前能力最强的模型GPT-5.5。在写代码、做科研和知识型工作这三块领域,它都实现了跨越式的进步,而推理延迟却维持在与上代相当的水平。这标志着AI正式从问答工具形态,迈向能够独立处理复杂计算机任务的智能代理形态。
就模型能力而言,GPT-5.5在Terminal-Bench 2.0编程评测、OSWorld-Verified(衡量代理操控真实桌面环境的基准)以及GDPval(涵盖44种职业的知识工作评估)等多项测试中,均以明显优势领先Claude Opus 4.7和Gemini 3.1 Pro。
现在,Plus、Pro、Business、Enterprise用户可以在ChatGPT中直接使用GPT-5.5,Codex平台也同步上线。定价层面,OpenAI坦承新模型定价高于前代,但强调其更高的token使用效率能摊薄综合成本,整体竞争力依然在线。
OpenAI联合创始人兼总裁Greg Brockman介绍,这个模型可以在仅有简单指令的情况下自主完成任务,调用邮件、电子表格、日历等工具执行用户意图。”它会自己想办法解决,遇到模糊情况也能应对,”他说,”整个体验更接近直觉交互。”
MagicPath首席执行官Pietro Schirano分享了一个例子:GPT-5.5大约花了20分钟,就一口气处理完了一次涉及数百项前端修改与重构的分支合并,并直言:”感觉就像在跟某种更高层次的智慧生物协作,甚至有点敬畏。”

性能跃升:速度不降,智能拉满
GPT-5.5最关键的技术突破,是打破了”越强越慢”这条业内默认规律。OpenAI表示,在生产环境中,它的实际延迟与GPT-5.4相当,但各项基准成绩大幅甩开前代。
代理编程领域几个关键数字:Terminal-Bench 2.0得分82.7%,而GPT-5.4是75.1%;能反映真实GitHub问题解决能力的SWE-Bench Pro上,得分58.6%;长周期编程任务基准Expert-SWE(任务中位完成时间约20小时)上同样超过前代。

特别值得注意的是,以上成绩均以更少的token消耗取得——效率提升是实实在在的。
在计算机使用方面,GPT-5.5在OSWorld-Verified测试中拿到78.7%,微超Claude Opus 4.7的78.0%。工具调用测试Tau2-bench Telecom上,GPT-5.5在无任何提示词调优的情况下达到98.0%,前代GPT-5.4仅有92.8%。
第三方评估机构Artificial Analysis的综合编程指数显示,GPT-5.5以约前沿竞品一半的成本,实现了相当水平的智能表现。
工程实测:量变带来质变的使用体验
多位技术负责人的实测反馈表明,GPT-5.5在真实工程场景中带来的提升,远超基准分数能传达的范围。
Every公司创始人兼CEO Dan Shipper讲述了一次测试经历:一个困扰工程团队数天的线上问题,他用GPT-5.5重演故障情境,模型给出的修复思路与顶级工程师事后做出的系统重构决策高度吻合,而GPT-5.4没能做到这一点。
他称GPT-5.5是”我用过的第一个真正具备概念清晰度的编程模型”。

Lovable联合创始人兼CTO Fabian Hedin反映,身份验证流程、实时同步、多文件编辑这些以前需要来回多轮的任务,现在”一次就能命中”。
一位提前拿到访问权限的NVIDIA工程师说得很直接:”失去GPT-5.5的访问权限,感觉就像被截断了一条肢体。”

知识工作:从辅助角色迈向全流程代理
OpenAI将GPT-5.5的适用场景延伸至更宽泛的知识工作领域,并以公司内部实践为佐证。
据披露,目前超过85%的OpenAI员工每周都在使用Codex,覆盖软件工程、财务、传播、市场、数据科学和产品管理等多个部门。
财务团队借助Codex审核了总计24,771份、合计71,637页的K-1税务表格,比前一年提前整整两周完工。传播团队则利用GPT-5.5构建了一套演讲请求的评分与风险评估框架,低风险请求已实现自动化处理。
在GDPval测试(评估模型在44个职业领域完成明确知识工作的能力)中,GPT-5.5得分84.9%;OSWorld-Verified上得分78.7%;Tau2-bench Telecom上,未经任何调优就达到98.0%。

NVIDIA企业AI副总裁Justin Boitano表示,GPT-5.5让工程团队把调试时间从几天压缩到几小时,实验周期从数周浓缩到一夜,”这不只是写代码更快,而是在用一种全新的方式帮人们以截然不同的速度工作。”
科研潜力:开始扮演”联合科学家”角色
在学术科研方向,GPT-5.5在多项生物学与数学基准上表现明显进步,OpenAI将其定位为能够切实加速生物医学前沿研究的”联合科学家”。
专注遗传学与定量生物学多阶段数据分析的GeneBench测试中,GPT-5.5得分25.0%,高于前代的19.0%;Pro版本进一步推高至33.2%。

生物信息学基准BixBench上,GPT-5.5以80.5%的成绩在已披露结果的模型中领跑,前代为74.0%。

Jackson实验室免疫学教授Derya Unutmaz用GPT-5.5 Pro分析了一组含62个样本、近28,000个基因的基因表达数据集,产出了涵盖关键发现与新兴洞察的详尽报告——他说,同样的工作原本需要团队耗费数月。
数学领域,OpenAI透露,配合自定义运行框架的GPT-5.5内部版本协助发现了一项关于非对角Ramsey数渐近性质的新证明,并在Lean系统中得到形式化验证。
OpenAI表示,这是模型真正参与核心研究并贡献出”令人意外且有实际价值的数学论证”的案例,而不仅仅是写代码或做解释。
安全机制:能力提升,防护同步跟进
随着模型整体能力的提升,OpenAI也对GPT-5.5的安全框架进行了同步升级,在网络安全与生化两个领域,将该模型的能力评级标注为”高级”(High)。
在GPT-5.2已引入网络安全专项防护的基础上,GPT-5.5进一步部署了针对高风险行为的更严格分类器及反复滥用保护机制,部分用户在使用初期可能会碰到相对频繁的访问限制。
网络安全基准CyberGym上,GPT-5.5得分81.8%,高于GPT-5.4的79.0%以及Claude Opus 4.7的73.1%。

与此同时,OpenAI推出”网络安全可信访问”(Trusted Access for Cyber)计划,向通过特定信任条件验证的用户开放网络安全功能的扩展权限,并允许负责关键基础设施防护的机构申请使用GPT-5.4-Cyber等专项模型。
定价与开放计划:API接口即将跟进
商业落地方面,GPT-5.5目前通过ChatGPT和Codex分层次向不同用户群体推出,API接口尚未全面开放。
ChatGPT中,GPT-5.5 Thinking面向Plus、Pro、Business及Enterprise用户;GPT-5.5 Pro则仅面向Pro、Business和Enterprise。
Codex平台上,GPT-5.5向Plus、Pro、Business、Enterprise、Edu及Go计划用户提供,上下文窗口为40万tokens,同时提供Fast模式(速度提升1.5倍,定价为标准价2.5倍)。
API定价:标准版gpt-5.5为每百万输入tokens 5美元、每百万输出tokens 30美元,上下文窗口100万tokens;批量和弹性方案半价,优先处理则按2.5倍计费。专业版gpt-5.5-pro定价为输入30美元/百万tokens、输出180美元/百万tokens。API接口”即将”上线。