AI 补贴时代的终结:为什么固定费率定价正在失效
在过去的几年里,AI 行业一直处于一种默契之下:即“补贴时代”。公司将 AI 功能集成到其产品套件的每一个层级中,赌的是推理成本会下降得足够快,从而使固定费率的订阅模式变得可持续。
然而,最近的市场信号表明,这一赌注正在失败。从 Microsoft 取消内部许可,到 Uber 在短短四个月内就耗尽了其 2026 年的 AI 预算,整个行业正面临瓶颈。成本曲线并没有向有利于提供商的方向弯曲;它正朝着相反的方向弯曲。
诱导性需求陷阱
许多商业模式建立在一个简单的推论之上:随着每个 token 的成本下降,总账单也会随之减少。这忽略了诱导性需求的原则。在城市规划中,增加高速公路车道并不会减少交通;它会创造出以前不存在的新通勤需求。AI 也遵循同样的逻辑。
随着推理变得更便宜、更强大,用户并不会仅仅以更少的钱做同样的工作。相反,他们会扩大对模型的要求。我们正看到从单一提示词交互向复杂的智能体工作流(agentic workflows)转变,其中单个任务可能会触发 50 次独立的 API 调用。曾经需要两分钟的推理查询现在需要四分钟。虽然单个 token 的单位成本可能会下降,但消耗的 token 数量正在爆炸式增长,导致总支出净增加。
硬件瓶颈:稀缺性定价
虽然软件效率在提高,但物理供应链却难以跟上步伐。前沿模型的主要瓶颈不再仅仅是晶体管,而是高带宽内存(HBM)以及将内存与计算芯片粘合在一起所需的先进封装技术(例如 TSMC 的 CoWoS)。
这种稀缺性导致了只能被称为“稀缺性定价”的情况。报告显示,下一代加速器的物料清单(BOM)成本正在急剧上升,仅内存成本就出现了大幅增长。当底层硬件成本增加,且供应链的交货周期为 18 到 36 个月时,实验室不得不将这些成本转嫁给下游。
这种财务压力在数据中显而易见。一些报告表明,前沿实验室在计算上的支出比其产生的收入还要多出数十亿美元,导致他们在推理方面处于“亏损”状态,并被迫重新定价其服务以维持运营。
迈向可持续的定价架构
产品团队不再能问“我们可以在哪里添加 AI?”相反,他们必须问“哪些用例能赚回它们消耗的推理成本?”这需要 AI 产品定价方式的根本转变。行业正在从假装成本是固定的按人头计费(per-seat pricing)模式,转向将收入与底层事件挂钩的模式:
- 按动作计费 (Per-Action Pricing): 类似于 Twilio 或 AWS 的模式,每一次 API 调用或智能体步骤都有一个价格。这确保了无论“重度用户”如何频繁使用系统,毛利率都能保持稳定。
- 基于积分的系统 (Credit-Based Systems): 预付积分包允许公司平滑现金流,并将不同的模型成本(例如,在处理简单任务时路由到廉价模型,在处理推理任务时路由到昂贵模型)整合在单一单位之后。
- 混合模式 (Hybrid Models): 基础平台费(按人头计费)结合包含的积分以及超额计费。这为销售团队渴望的预测性提供了保障,同时也为提供商提供了安全阀。
反方观点:本地与开源的替代方案
虽然云端推理成本在上升,但一个平行的趋势正在涌现:高性能本地模型的兴起。有人认为,如果用户利用开源模型和自己的硬件,对于终端用户来说,“单位美元的智能度”实际上是在下降的。
随着 Qwen 或 DeepSeek 等模型提供与专有前沿模型相当的能力,且成本仅为后者的一小部分,将工作负载转移到本地的动力正在增加。这种向“自带模型”(BYOM)或本地托管的转变,可能会彻底颠覆以云为中心的定价模式,使 AI 成为一种运行在消费级硬件上的公用事业,而非一种按量计费的云服务。
总结
对于那些受困于固定费率、按人头计费模式的公司来说,面临着二选一的抉择:要么随着使用量的增长而吸收利润率的压缩,要么从较低层级中剥离 AI 功能,并冒着失去用户漏斗的风险。对于那些能够转向按量计费或混合定价模式的公司,前路是清晰的:将你的收入与所消耗计算资源的价值——以及成本——挂钩。