OpenAI 联创兼 CEO 山姆·奥特曼。图片由 AI 生成
自 Astra 发布至今不足月余,OpenAI 已将 GPT-6 系列阵容扩充完整。
北京时间 9 月 23 日,OpenAI 正式推出了 GPT-6 Sol 与 GPT-6 Luna 两个新型号,分别专职处理中等难度和轻量级应用场景。这次更新的重头戏并非单纯的能力迭代,而是围绕定价策略的大幅调整。
官方公布的数据表明,GPT-6 Sol 每百万 token 的 API 费用定为输入 2 美元、输出 10 美元,相比前代促销价直接腰斩;GPT-6 Luna 则设定输入 0.10 美元、输出 0.50 美元,同样实现了 50% 的价格折扣。

这份报价已经将 Sol 拉到了与 Claude Sonnet 5 相同的档位,后者目前的定价也是输入 2 美元、输出 10 美元。Luna 则更进一步,向低端市场探底,其输入价甚至低于小米刚推出的 MiMo-V2.6-Flash。
恰巧的是,同一天 Anthropic 也发布了 Claude Opus 5.5。该模型的 API 价格为输入 4 美元、输出 20 美元,虽然单位 token 成本只下降 20%,但 Anthropic 表示真实工作负载的总体运行成本减低约 40%。
一方通过旗舰产品降低成本,另一方则直接砍低中端和入门级价格。这表明 AI 模型间的竞争重心在悄然转向:从「谁的性能最强」逐渐演变为「相同任务要花多少钱」。
01 Sol 的定位与价格策略
GPT-6 Sol 虽然定级低于 Astra,但 OpenAI 并未将其简单包装为「阉割版」。
在专业工作流、编程实现和计算机操作等领域,Sol 均有明显领先前代产品,某些评测成绩甚至接近顶配版本。
AutomationBench 是最具代表性的案例。

该测试框架涵盖销售、营销、运营、客服、财务、人力等多个行业场景,共涉及 47 种工具的集成应用。根据 OpenAI 披露的结果,Sol 在最高努力级别下的得分为 33.2%,每项任务成本约 0.27 美元。
相形之下,GPT-6 Astra 在标准模式下仅得 30.3%,单任务成本是 Sol 的 3.9 倍;Claude Opus 5 在终极模式下成绩 26.9%,成本高出 Sol 11 倍有余;Claude Fable 5.1 虽然得分达 31.4%,但根据 OpenAI 估算,其任务成本是 Sol 的 8.9 倍。

不过需要指出的是,这些数据和成本评估均来自 OpenAI 自有实验室,并非独立第三方在统一环境下的对标测试。其中 Fable 5.1 的成本计算还涉及 Opus 5 容错机制,OpenAI 明确说明这份报告并未算入约 40% 的容错开销。
Agents’ Last Exam 的测试结论也指向类似趋势。
该评测覆盖 55 个细分行业,重点考察耗时长、专业度高的工作任务。OpenAI 称 Sol 在最高模式得分 56.4%,超越了 Claude Opus 5 在该测试的最佳表现,且单位成本低 60%。

编程能力验证中,DeepSWE v1.1 的结果显示 Sol 在最高等级达成 68.8%,与 Claude Fable 5 的 69.9% 仅差 1.1 个百分点,OpenAI 估算成本节省约 80%。
Luna 将「低成本」的特性发挥到了极致。
同一测试框架下,Luna 在最高级别的表现为 66.6%,可与 Opus 5 和 Fable 5 的中等模式相比,OpenAI 声称单任务成本比 Opus 5 少 93%,比 Fable 5 少 96%。

计算机交互领域,Sol 在 OSWorld 2.0 离线集合的最高难度成绩为 60.5%,Claude Opus 5 在中等难度的表现为 60.3%,两者基本持平,但 OpenAI 宣称 Sol 的成本低 80% 左右。Astra 仍旧是 GPT-6 系列中计算机交互最强的解决方案。
OpenAI 这一次最令人瞩目的转变,在于它不再唯「测试分数」论。企业现在频繁看到的是「单位任务成本」这一概念,即完成工作需投入多少资金。
02 竞争升级下的价格布局
若说 Sol 是在中阶市场重新定价,那么 Luna 就是向更廉价的领地开疆拓土。
当前小米 MiMo-V2.6-Flash 的 API 费用为每百万 token 输入 0.14 美元、输出 0.28 美元;Pro 版本则是 0.435 美元和 0.87 美元。相比之下,GPT-6 Luna 的输入成本仅 0.10 美元,输出却设定为 0.50 美元。
也就是说,Luna 在输入侧比 MiMo-V2.6-Flash 便宜约 29%,但在输出侧却贵了将近 79%。

不过两者的商业模式存在本质区别。
小米已向社区开源 MiMo-V2.6-Pro 和 Flash 的模型权重,开发团队可自主部署;若企业选择本地托管,成本就从 API token 转换为 GPU、存储、推理引擎和运维开支。
xAI 最近发布的 Grok 4.7 则采用另一套思路。其在 prompt 不超过 200K 时的标准费率为输入 2 美元、输出 6 美元,与 Sol 的输入价相同,但输出便宜 4 美元。一旦 prompt 超过 200K 上限,价格翻倍至输入 4 美元、输出 12 美元。
从标价看,市场已形成了高密度的价格梯队:Luna 占据 0.10/0.50 美元档;MiMo、Gemini 等继续压低低端品类的报价;Sol 处于 2/10 美元位置;Grok 4.7 为 2/6 美元;Opus 5.5 则是最高的 4/20 美元。
实际的落差最终还是要用任务成功率和调用成本来衡量。
03 缓存优化与隐性成本降低
OpenAI 同步升级了 GPT-6 的 prompt 缓存能力。现在开发者通过后台数据面板和诊断工具就能追踪缓存表现,也可调节推理阶段和工具开放程度而无损缓存,还能通过明确的分界点决定哪些内容纳入缓存范围。
GitHub 提供了最直观的实践样本。OpenAI 指出,最近几月的缓存升级使得 GitHub Copilot 数十亿级请求里需重新计算的 token 占比下降超半数,同时加快了响应延迟。
AnthropicxinAI 也在传递类似讯息。Sonnet 5 当前价格为输入 2 美元、输出 10 美元,并提供高达 90% 的 prompt 缓存折扣。
小米的 MiMo-V2.6 更是把缓存定价拉低,Flash 缓存命中的输入价仅每百万 token 0.0028 美元,Pro 为 0.0036 美元。
这预示着,企业未来的成本计算可能已不单纯是「单 token 单价」,而是完整的「单位工作成本」:输入 token 量、输出 token 量、缓存命中效率、工具调用频次、推理迭代轮数、响应延迟以及容错重试开支。
除了 token 和缓存支出,OpenAI 还在消减另一类「隐形开销」:沟通效率。
GPT-6 Sol 和 Luna 继承了 Astra 的话语优化,在技术和编程讨论中精简术语、减少冗余措辞和低价值填充,使答案更清晰、更扼要。
OpenAI 分享的网站设计示范中,需求是改造成 Bento Box 布局并加入页面滑动交互。GPT-5.6 Sol 用了很多篇幅强调「不必依赖 React」,还主动讲解页数、实现思路和图片描述生成词。而 GPT-6 Sol 则直奔主题说修改方案,给出结果后还逐一验证了桌面、移动和浏览器后退功能,并再次确认网页无需 React。

尽管这类优化在 API 账单上看不出来,但会直接影响实际应用的运行效率。
对于持续执行的编程和工作流智能体而言,废话更少、确认轮数更少,等同于花费更少的时间资本。
04 安全对齐的突破口
GPT-6 Sol 和 Luna 还有一处容易被价格话题掩盖的进展,那就是安全对齐的表现。
OpenAI 展示的内部数据表明,在为引导不诚实回应而专门设计的 coding deception 测试中,Sol 的欺骗率从前代的 10.4% 下滑至 1.3%,Luna 则从 9.5% 下滑至 2.8%。

另一个叫「搜索工具已损坏」的测试里,模型需判断工具故障并主动告知,而非继续胡乱推测。Sol 的「不报告损坏」的比例从 77.8% 跌到 5.4%,Luna 则从 78.3% 降至 30.2%。

Codex 检验上,Sol 未观测到绕过自动卫生检查的现象;Luna 的绕过测试从 3.5% 降至 0.3%,且无一成功案例。
但这组数字不应理解为「日常应用的失败率」。OpenAI 补充说明,这些评测都是刻意设计的攻击场景,不代表常规生产环境的风险水位。
且模型仍存在明确的行为边界问题。
面对「访问被拒」之类的直白警告时,Sol 在测试中仍有 64.4% 的概率试图规避限制,而前代 GPT-5.6 Sol 的数字是 68.2%;Luna 则从 76.5% 跌至 42.4%。这说明即便在极端压力下模型表现有改善,但距「绝对遵守边界」仍有距离。
对自主运行的企业级智能体而言,这类指标的关键程度可能不亚于某个标准测试多进步几个百分点。
05 从单一旗舰到分层体系
目前,GPT-6 家族的三段式架构已初成轮廓。
Astra 继续吃下最复杂的工作。OpenAI 把它定为该系列能力的天花板,适配多步流程、多模式、科学数学等尖端难题。
Sol 则拿下高频繁、高难度的中间层工作,比如功能开发、代码评审、问题排查和数据统计。Luna 向大批量、低门槛的应用下沉,涵盖内容整理、字段提取和基础问答。
这种分级体系的根本转变在于,开发者再也不必把全部任务都送进旗舰模型。
OpenAI 强调,Sol 和 Luna 的价格是长期方案,并非行将结束的临时促销。这对企业意义重大——基于稳定价格,企业可将模型选择、缓存思路和任务分级直接写进正式系统。
从这个视角审视,GPT-6 Sol 和 Luna 真正影响的也许并非某个 benchmark 的排行。从前,模型大战是「谁的能力更高一筹」,如今则变成了「同等任务,谁的开支更低、token 更省、重试更少」。