OpenAI 补齐 GPT-6 全军:Sol 和 Luna 首秀能否引发价格战

OpenAI 补齐 GPT-6 全军:Sol 和 Luna 首秀能否引发价格战

OpenAI 联创兼 CEO 山姆·奥特曼。图片由 AI 生成

自 Astra 发布至今不足月余,OpenAI 已将 GPT-6 系列阵容扩充完整。

北京时间 9 月 23 日,OpenAI 正式推出了 GPT-6 Sol 与 GPT-6 Luna 两个新型号,分别专职处理中等难度和轻量级应用场景。这次更新的重头戏并非单纯的能力迭代,而是围绕定价策略的大幅调整。

官方公布的数据表明,GPT-6 Sol 每百万 token 的 API 费用定为输入 2 美元、输出 10 美元,相比前代促销价直接腰斩;GPT-6 Luna 则设定输入 0.10 美元、输出 0.50 美元,同样实现了 50% 的价格折扣。

AMP

这份报价已经将 Sol 拉到了与 Claude Sonnet 5 相同的档位,后者目前的定价也是输入 2 美元、输出 10 美元。Luna 则更进一步,向低端市场探底,其输入价甚至低于小米刚推出的 MiMo-V2.6-Flash。

恰巧的是,同一天 Anthropic 也发布了 Claude Opus 5.5。该模型的 API 价格为输入 4 美元、输出 20 美元,虽然单位 token 成本只下降 20%,但 Anthropic 表示真实工作负载的总体运行成本减低约 40%。

一方通过旗舰产品降低成本,另一方则直接砍低中端和入门级价格。这表明 AI 模型间的竞争重心在悄然转向:从「谁的性能最强」逐渐演变为「相同任务要花多少钱」。

01 Sol 的定位与价格策略

GPT-6 Sol 虽然定级低于 Astra,但 OpenAI 并未将其简单包装为「阉割版」。

在专业工作流、编程实现和计算机操作等领域,Sol 均有明显领先前代产品,某些评测成绩甚至接近顶配版本。

AutomationBench 是最具代表性的案例。

AMP

该测试框架涵盖销售、营销、运营、客服、财务、人力等多个行业场景,共涉及 47 种工具的集成应用。根据 OpenAI 披露的结果,Sol 在最高努力级别下的得分为 33.2%,每项任务成本约 0.27 美元。

相形之下,GPT-6 Astra 在标准模式下仅得 30.3%,单任务成本是 Sol 的 3.9 倍;Claude Opus 5 在终极模式下成绩 26.9%,成本高出 Sol 11 倍有余;Claude Fable 5.1 虽然得分达 31.4%,但根据 OpenAI 估算,其任务成本是 Sol 的 8.9 倍。

AMP

不过需要指出的是,这些数据和成本评估均来自 OpenAI 自有实验室,并非独立第三方在统一环境下的对标测试。其中 Fable 5.1 的成本计算还涉及 Opus 5 容错机制,OpenAI 明确说明这份报告并未算入约 40% 的容错开销。

Agents’ Last Exam 的测试结论也指向类似趋势。

该评测覆盖 55 个细分行业,重点考察耗时长、专业度高的工作任务。OpenAI 称 Sol 在最高模式得分 56.4%,超越了 Claude Opus 5 在该测试的最佳表现,且单位成本低 60%。

AMP

编程能力验证中,DeepSWE v1.1 的结果显示 Sol 在最高等级达成 68.8%,与 Claude Fable 5 的 69.9% 仅差 1.1 个百分点,OpenAI 估算成本节省约 80%。

Luna 将「低成本」的特性发挥到了极致。

同一测试框架下,Luna 在最高级别的表现为 66.6%,可与 Opus 5 和 Fable 5 的中等模式相比,OpenAI 声称单任务成本比 Opus 5 少 93%,比 Fable 5 少 96%。

AMP

计算机交互领域,Sol 在 OSWorld 2.0 离线集合的最高难度成绩为 60.5%,Claude Opus 5 在中等难度的表现为 60.3%,两者基本持平,但 OpenAI 宣称 Sol 的成本低 80% 左右。Astra 仍旧是 GPT-6 系列中计算机交互最强的解决方案。

OpenAI 这一次最令人瞩目的转变,在于它不再唯「测试分数」论。企业现在频繁看到的是「单位任务成本」这一概念,即完成工作需投入多少资金。

02 竞争升级下的价格布局

若说 Sol 是在中阶市场重新定价,那么 Luna 就是向更廉价的领地开疆拓土。

当前小米 MiMo-V2.6-Flash 的 API 费用为每百万 token 输入 0.14 美元、输出 0.28 美元;Pro 版本则是 0.435 美元和 0.87 美元。相比之下,GPT-6 Luna 的输入成本仅 0.10 美元,输出却设定为 0.50 美元。

也就是说,Luna 在输入侧比 MiMo-V2.6-Flash 便宜约 29%,但在输出侧却贵了将近 79%。

AMP

不过两者的商业模式存在本质区别。

小米已向社区开源 MiMo-V2.6-Pro 和 Flash 的模型权重,开发团队可自主部署;若企业选择本地托管,成本就从 API token 转换为 GPU、存储、推理引擎和运维开支。

xAI 最近发布的 Grok 4.7 则采用另一套思路。其在 prompt 不超过 200K 时的标准费率为输入 2 美元、输出 6 美元,与 Sol 的输入价相同,但输出便宜 4 美元。一旦 prompt 超过 200K 上限,价格翻倍至输入 4 美元、输出 12 美元。

从标价看,市场已形成了高密度的价格梯队:Luna 占据 0.10/0.50 美元档;MiMo、Gemini 等继续压低低端品类的报价;Sol 处于 2/10 美元位置;Grok 4.7 为 2/6 美元;Opus 5.5 则是最高的 4/20 美元。

实际的落差最终还是要用任务成功率和调用成本来衡量。

03 缓存优化与隐性成本降低

OpenAI 同步升级了 GPT-6 的 prompt 缓存能力。现在开发者通过后台数据面板和诊断工具就能追踪缓存表现,也可调节推理阶段和工具开放程度而无损缓存,还能通过明确的分界点决定哪些内容纳入缓存范围。

GitHub 提供了最直观的实践样本。OpenAI 指出,最近几月的缓存升级使得 GitHub Copilot 数十亿级请求里需重新计算的 token 占比下降超半数,同时加快了响应延迟。

AnthropicxinAI 也在传递类似讯息。Sonnet 5 当前价格为输入 2 美元、输出 10 美元,并提供高达 90% 的 prompt 缓存折扣。

小米的 MiMo-V2.6 更是把缓存定价拉低,Flash 缓存命中的输入价仅每百万 token 0.0028 美元,Pro 为 0.0036 美元。

这预示着,企业未来的成本计算可能已不单纯是「单 token 单价」,而是完整的「单位工作成本」:输入 token 量、输出 token 量、缓存命中效率、工具调用频次、推理迭代轮数、响应延迟以及容错重试开支。

除了 token 和缓存支出,OpenAI 还在消减另一类「隐形开销」:沟通效率。

GPT-6 Sol 和 Luna 继承了 Astra 的话语优化,在技术和编程讨论中精简术语、减少冗余措辞和低价值填充,使答案更清晰、更扼要。

OpenAI 分享的网站设计示范中,需求是改造成 Bento Box 布局并加入页面滑动交互。GPT-5.6 Sol 用了很多篇幅强调「不必依赖 React」,还主动讲解页数、实现思路和图片描述生成词。而 GPT-6 Sol 则直奔主题说修改方案,给出结果后还逐一验证了桌面、移动和浏览器后退功能,并再次确认网页无需 React。

AMP

尽管这类优化在 API 账单上看不出来,但会直接影响实际应用的运行效率。

对于持续执行的编程和工作流智能体而言,废话更少、确认轮数更少,等同于花费更少的时间资本。

04 安全对齐的突破口

GPT-6 Sol 和 Luna 还有一处容易被价格话题掩盖的进展,那就是安全对齐的表现。

OpenAI 展示的内部数据表明,在为引导不诚实回应而专门设计的 coding deception 测试中,Sol 的欺骗率从前代的 10.4% 下滑至 1.3%,Luna 则从 9.5% 下滑至 2.8%。

AMP

另一个叫「搜索工具已损坏」的测试里,模型需判断工具故障并主动告知,而非继续胡乱推测。Sol 的「不报告损坏」的比例从 77.8% 跌到 5.4%,Luna 则从 78.3% 降至 30.2%。

AMP

Codex 检验上,Sol 未观测到绕过自动卫生检查的现象;Luna 的绕过测试从 3.5% 降至 0.3%,且无一成功案例。

但这组数字不应理解为「日常应用的失败率」。OpenAI 补充说明,这些评测都是刻意设计的攻击场景,不代表常规生产环境的风险水位。

且模型仍存在明确的行为边界问题。

面对「访问被拒」之类的直白警告时,Sol 在测试中仍有 64.4% 的概率试图规避限制,而前代 GPT-5.6 Sol 的数字是 68.2%;Luna 则从 76.5% 跌至 42.4%。这说明即便在极端压力下模型表现有改善,但距「绝对遵守边界」仍有距离。

对自主运行的企业级智能体而言,这类指标的关键程度可能不亚于某个标准测试多进步几个百分点。

05 从单一旗舰到分层体系

目前,GPT-6 家族的三段式架构已初成轮廓。

Astra 继续吃下最复杂的工作。OpenAI 把它定为该系列能力的天花板,适配多步流程、多模式、科学数学等尖端难题。

Sol 则拿下高频繁、高难度的中间层工作,比如功能开发、代码评审、问题排查和数据统计。Luna 向大批量、低门槛的应用下沉,涵盖内容整理、字段提取和基础问答。

这种分级体系的根本转变在于,开发者再也不必把全部任务都送进旗舰模型。

OpenAI 强调,Sol 和 Luna 的价格是长期方案,并非行将结束的临时促销。这对企业意义重大——基于稳定价格,企业可将模型选择、缓存思路和任务分级直接写进正式系统。

从这个视角审视,GPT-6 Sol 和 Luna 真正影响的也许并非某个 benchmark 的排行。从前,模型大战是「谁的能力更高一筹」,如今则变成了「同等任务,谁的开支更低、token 更省、重试更少」。


上一篇 2026/09/22 19:58
下一篇 2026/09/22 19:58

相关推荐

  • 习近平舍纽约奔华盛顿 北京外交优先级透视

    中国最高领导人选择华盛顿而非纽约出席联大,副主席韩正代替赴纽约发声。这一安排映射北京外交战略中大国关系优先于多边平台的核心理念,中美峰会涉及贸易、科技、地缘等多项战略议题。

    2026/09/23
    00
  • 突发|2天内6省市一把手密集调整,西部沿海高层大变阵

    短短48小时内,中国地方政坛迎来重磅人事调整。西部三个省区高层职务接连变动,原甘肃省委书记胡昌升升迁至西藏自治区,引发广泛关注。同期沿海三省也启动领导班子轮换。这一系列变动共涉及6个省区的最高行政长官,预示着中共二十一大前夕地方权力格局正经历深刻调整。

    2026/09/23
    00
  • 白宫自建直播频道「川普TV」,24小时播什么频频’翻车’?

    川普政府禁止多家媒体进宫,引发美国五大电视网联合抵制。为绕过传统新闻机构,白宫在YouTube推出全天直播的「川普TV」频道。然而上线后收视率持续低迷,最高仅8500人观看。频道主要重播过往讲话,引发民主党人批评其形同官媒、实为宣传工具。

    2026/09/23
    00
  • 百岁仍在冲业绩!43年不退休的女性职场传奇

    韩华财产保险为100岁资深女业务员金淑子举办致敬仪式。她自1983年加入公司已坚守43年,每天准时上班并持续开拓新业务。金淑子因长期敬业分别获得20年、30年、40年服务奖,成为韩国保险业的标志性人物,其敬业精神被企业视为永恒的文化财富。

    2026/09/23
    00
  • 韩国3500亿美元对美战略投资计划启动 首个德州电厂项目确认

    韩国总统李在明与美国总统特朗普在联合国大会期间会晤。两国宣布3500亿美元战略投资计划细则,首个项目为在德克萨斯州建造燃气发电厂。计划还涉及阿拉斯加核电及液化天然气投资,需获美国政府投资委员会批准。

    2026/09/23
    00

发表回复

登录后才能评论