Cloudflare 已在 AI Gateway 的自定义成本核算中添加了缓存读取和缓存写入令牌率,这是一项小型变更日志项目,对于跨提供商转售、路由或协调模型使用的团队而言,会带来巨大的计费后果。
9 月 9 日的更新意味着开发人员现在可以在 cf-aig-custom-cost 标头中传递 per_cache_read_token 和 per_cache_write_token 值。 Cloudflare 表示,当存在任一特定于缓存的速率时,AI Gateway 会激活缓存令牌定价并考虑提供商差异,因此相同的缓存使用不会被计算两次。
这听起来很狭窄。它不是。缓存定价已成为统一 AI API 计费中较难的部分之一,特别是当提供商对重用上下文使用不同的名称、单位和计费规则时。将每个缓存的令牌视为普通输入令牌可能很简单,但它可能是错误的,足以消除经销商利润或误导客户了解哪些工作负载实际上很昂贵。
发生了什么变化
AI Gateway 已经允许将自定义成本数据附加到请求中,为团队提供了一种表示协商费率或内部价格手册的方法,而不仅仅是依赖公共提供商定价。新的更改将该机制扩展到特定于缓存的令牌类别。
实际上,网关操作员现在不仅可以告诉 Cloudflare 输入或输出令牌的成本,还可以告诉 Cloudflare 缓存读取或缓存写入的成本。这种区别很重要,因为提供商越来越多地将缓存作为自己的经济层进行定价。缓存写入可能比缓存读取花费更多。缓存读取可能比新输入便宜得多。某些提供商可能会在使用记录中以不同方式公开缓存创建和缓存检索。
Cloudflare 指出,它处理提供商差异以避免重复计算也很重要。缓存字段并不总是与输入令牌总数完全分开。如果计费系统天真地在提供商报告的输入使用量之上添加缓存令牌,则可能会向客户收取过高费用或增加内部成本。如果它忽略缓存字段,则可能会低估频繁创建缓存条目的长上下文应用程序的成本。
为什么缓存核算现在很重要
提示缓存曾经是一个优化细节。对于许多生产工作负载,它现在是价格架构的一部分。
长系统提示、检索增强上下文、编码代理存储库、法律文档包和支持知识库都受益于重用上下文。系统发送的重复上下文越多,缓存定价对实际单位经济性的影响就越大。如果一个请求写入缓存条目而另一个请求从中读取,则具有相似令牌计数的两个请求可能会产生截然不同的成本。
这使得缓存可见性成为财务问题,而不仅仅是工程问题。运行内部代理的团队可能需要知道新工作流程是否昂贵,因为它会生成太多新提示、错过缓存或过于频繁地写入大型缓存块。经销商可能需要向客户展示为什么一个应用程序的计费使用量低于预期,即使其明显的提示大小很大。网关供应商可能需要在日志、分析和分类账记录中保留缓存字段,以便月末对账与提供商发票相匹配。
这也是 AI API 成本分析要求更高的地方。聚合请求成本已经不够了。团队需要分别查看输入、输出、缓存写入和缓存读取行为,然后将这些类别连接到 API 密钥、客户、模型和路由。
谁受到影响
直接受众是依赖自定义成本而不是默认公开定价的 Cloudflare AI Gateway 用户。其中包括协商模型费率的企业、为客户标记提供商使用情况的平台,以及使用 Cloudflare 作为跨多个模型提供商的共享控制平面的团队。
经销商尤其容易受到影响。如果经销商使用简化的代币模型向客户收费,同时根据缓存感知定价向提供商付款,则差额可能会悄悄累积。缓存写入不足或缓存读取过多可能不会出现在单个请求中,但在代理会话、批处理或大容量检索工作负载中可能会产生影响。
构建与 OpenAI 兼容的网关层的开发人员即使不直接使用 Cloudflare,也会受到影响。这一变化反映了市场更广泛的方向:提供商的计费界面变得更加精细,而客户仍然期望干净的发票和可预测的使用报告。如果 Model Gate 等产品想要跨多个提供商提供准确的客户范围报告、使用限制和利润分析,则需要将缓存令牌字段视为一流的分类账数据。
实际后果
网关团队应检查其请求日志、成本计算器和发票如何表示缓存活动。如果缓存读取和写入被扁平化为普通提示令牌,则分析可能看起来比底层账单更简单。如果提供商使用记录包含在摄取过程中删除的缓存字段,则以后的协调将会很困难。
定价引擎还需要支持每个方向多个费率。旧的输入与输出分割对于高级模型会计来说不再足够。可信的模型分类帐现在需要空间来容纳新的输入令牌、输出令牌、缓存写入、缓存读取以及这些类别的可能特定于提供商的变体。
面向客户的仪表板应仔细揭示这些区别。大多数用户不想阅读原始的提供商遥测数据,但他们确实需要了解为什么当应用程序开始更有效地重用上下文时成本会发生变化。最好的界面可能是成本明细,显示缓存节省和缓存创建成本,而无需强迫客户学习每个提供商的术语。
警报和限制也有操作影响。仅基于总令牌的客户预算限制可能无法捕获写入昂贵的缓存条目的工作负载。仅基于请求计数的保证金警报可能会错过提供商定价不匹配的情况。对于通过每个客户密钥销售访问权限的团队,缓存感知会计应与用于支出控制的相同客户、项目或应用程序标识符联系起来。
什么仍然开放
变更日志建立了对缓存读取和缓存写入自定义速率的支持,但它并没有解决网关运营商的每个实施问题。团队仍然需要测试其特定提供商如何报告缓存使用情况、Cloudflare 的计算成本如何显示在日志和导出中,以及如何将现有发票与新的自定义成本字段进行比较。
不过,更大的方向是明确的。人工智能网关计费正在从简单的令牌计转向详细的使用分类账。缓存定价现在是该分类账的一部分。保留细节的团队将拥有更清晰的协调和更好的客户分析。将其折叠起来的团队可能不会注意到问题,直到他们的提供商账单和客户发票不再讲述相同的故事。