OpenAI 对其 GPT-5.6 API 系列进行了重大定价和延迟调整,将 GPT-5.6 Luna API 价格降低了 80%,将 GPT-5.6 Terra 价格降低了 20%,并用新的快速模式取代了 GPT-5.6 Sol 的优先级处理。

该更新于 2026 年 7 月 30 日发布,改变了运行大容量推理工作负载的开发人员和企业的基本经济原理。 Terra API 目前的定价为每百万输入代币 2 美元,每百万输出代币 12 美元。 Luna 目前的定价为每百万个输入代币 0.20 美元,每百万个输出代币 1.20 美元。 OpenAI 表示,Terra 和 Luna 仍可在 ChatGPT Work、Codex 和 OpenAI API 中使用,同一天晚些时候,AWS 也开始推出定价变更。

这一变化不仅仅是折扣。 它改变了团队对模型层选择、后备规则、延迟预算和 AI API 成本控制的思考方式。 Luna 现在对低成本工作负载的定位更加积极,而 Terra 对于需要更强功能但不证明最高延迟或最高成本层合理的任务来说变得更便宜。 与此同时,Sol 现在通过快速模式拥有更清晰的高速选项。

OpenAI 的 API 定价发生了什么变化

标题数字是 GPT-5.6 Luna 降低了 80%。 以每百万输入令牌 0.20 美元和每百万输出令牌 1.20 美元的价格,Luna 成为大规模汇总、分类、提取、客户支持草稿、轻量级编码辅助和后台处理作业的更相关候选者,在这些作业中,单位成本比峰值推理质量更重要。

GPT-5.6 Terra 的 20% 降低幅度较小,但对于已经使用 Terra 进行更强大响应的生产系统来说仍然有意义。 其新的 API 价格为每百万输入代币 2 美元,每百万输出代币 12 美元。 对于产生大量输出的应用程序,例如报告起草、代码生成、辅导或代理规划,账单的输出代币方面仍然是主要变量。 即使是适度的百分比削减也可能在规模上变得重要。

OpenAI 还改变了 GPT-5.6 Sol 周围的延迟产品。 快速模式取代了 API 中的优先级处理,与标记为优先级的请求保持向后兼容,并且 OpenAI 称其速度比标准处理快 2.5 倍,但价格是标准处理的两倍。 这就产生了一个更明确的权衡:开发人员可以为紧急请求的较低延迟支付更多费用,同时将常规工作负载保持在标准处理上。

对于比较最便宜的 AI 模型 API 选项的团队来说,Luna 削减是最有可能迫使重新计算的部分。 价格敏感的工作负载以前可能被路由到其他提供商的较小模型、较旧的 OpenAI 模型或开放权重部署,现在可能需要针对 Luna 的新成本概况进行另一次基准测试。

为什么这对开发人员和产品团队很重要

AI 应用程序成本很少仅由一个模型价格决定。 真正的账单取决于路由策略、提示大小、完成长度、重试行为、缓存、用户并发性以及系统从更便宜的模型升级到更强大的模型的频率。 OpenAI 的新价格使这些路由决策变得更加重要,而不是变得更重要。

常见的生产模式是对大多数请求使用较低成本的模型,并且仅在任务需要更深入的推理、更好的编码性能、更强的指令遵循或更高的准确性时才升级。 由于 Luna 现在便宜得多,团队可以选择向 Luna 发送更多的首次流量,为中等复杂性任务保留 Terra,并使用 Sol 来处理对延迟最敏感或对功能最敏感的路径。

快速模式为该决策添加了第二个维度。 例如,支持聊天机器人可能不需要后台摘要的额外延迟,但当付费客户在实时聊天中等待时,它可能需要更快的响应时间。 编码助手可以为后台重构运行标准处理,但当开发人员在交互式会话中受阻时,则使用快速模式。

这就是 AI API 网关或多模型 API 层在操作上有用的地方。 团队可以集中策略,而不是在整个应用程序中硬编码模型名称和优先级标志:将例行请求路由到 Luna,将不明确的案例升级到 Terra,为高价值或面向用户的路径保留 Sol Fast 模式,并按产品、团队或客户应用预算上限。 Model Gate 在这里具有实际联系,因为 OpenAI 兼容的路由、统一计费、API 密钥管理和使用情况分析正是提供商更改价格或延迟模式时团队所需的控制点。

成本控制机会是真实的,但不是自动的

较低的模型价格并不能保证较低的账单。许多团队通过增加使用来应对更便宜的推理:更长的提示、更多的代理步骤、更多的重试、更多生成的替代方案或更广泛的功能推出。 这可能是正确的产品决策,但如果不仔细衡量使用情况,它可能会抵消预期的节省。

工程和财务团队的首要任务是比较新旧混合成本。 具有短输入和长输出的工作负载与以检索上下文或大提示为主的工作负载的受益方式不同。 已经严重依赖 Terra 的应用程序将直接减少,而能够安全地将流量从更昂贵的层转移到 Luna 的应用程序可能会获得更大的收益。

开发人员还应该在现实提示下重新测试质量、延迟和故障行为。 更便宜的模型只有在可靠地解决任务时才更便宜。 如果 Luna 对于特定用例需要更多的重试、更长的提示或额外的验证步骤,则有效的成本优势可能会小于标价所示的价格。 相反,如果它在大部分日常工作中表现足够好,那么新价格可能会极大地改变成本敏感的人工智能产品的架构。

价格变化后,使用情况分析变得尤为重要。 团队需要了解正在使用哪些模型、哪些路由生成最多的输出代币、哪些客户或内部团队推动支出,以及在哪里触发高级延迟模式。 如果没有这种可见性,快速模式可能会成为一个未被注意到的成本倍增器。

仍然不确定的事情

OpenAI 将部分服务成本改进归功于 GPT-5.6 Sol,帮助优化生产基础设施。 这是第一方的运营主张,公开材料没有提供对降价背后的基础设施节省的独立审计。

现在了解竞争对手将如何反应还为时过早。 Luna 定价的大幅下调给其他托管模型提供商、开放模型平台和网关定价页面带来了压力。 更广泛的市场反应将取决于比较质量、延迟、吞吐量限制、企业条款以及其他提供商是否会跟进自己的削减。

对于企业来说,最安全的反应不是将更新视为简单的采购胜利。 它应该触发路由审查。 哪些任务可以转移到Luna?哪个应该留在 Terra 上?哪些需要Sol Fast模式?哪些客户或内部团队可以使用高级延迟?这些决策将决定新定价是否会成为持久的利润改善,还是只是扩大推理需求的另一种方式。