便宜到无需计量的令牌——为何AI计算成本骤降

令牌成本下降速度超越以往任何趋势

过去12个月内,完成一项AI任务的价格下降了约2.5个数量级,这得益于硬件效率、模型架构和推理引擎的同步提升。这使得单个令牌的成本如此之低,以至于调用外部工具(如grep、HTML解析或cargo build)的开销很快将主导工作流的总成本。


硬件效率提升

GPU每两年效率翻倍

GPU能效(GFLOP/J)的对数图显示1.3对数斜率,意味着效率大约每两年翻一番——与摩尔定律的历史步伐相当。这一趋势在从早期消费级GPU到最新数据中心H100的各代产品中均保持一致。

"这是自20世纪60年代摩尔定律以来我们未曾见过的效率提升。" – 帖子作者

推理引擎每年提升10-50%

诸如vLLM等开源引擎在0.5.4版本(2024年9月)至0.11.1版本(2025年12月)之间实现了约40%的焦耳/令牌降低。NVIDIA的全栈MLPerf报告显示从2.0到2.1版本有高达50%的效率提升,而Intel的MLPerf 6.1相比6.0显示了2.4倍的吞吐量提升。


模型级成本降低

每任务成本下降,而每令牌价格停滞

前沿模型仍收取相似的每令牌费率,但更大的模型以更少的令牌完成任务。质量与成本的帕累托前沿(2025-2026)表明,今天运行同一基准测试的成本比一年前便宜100倍。

混合专家(MoE)削减计算量

MoE架构在不需要时停用专家层,在同等基准性能下可减少多达7倍的参数。尽管本地部署仍需要将所有专家加载到内存中,但整体的每焦耳质量显著提升。


专用模型加速趋势

Jev和Laya实现"免费"输出令牌

TypeSafe的Jev分类器对输入令牌收费**$0.042/百万令牌**,输出令牌**$0**——大约每十亿令牌$42,相当于阅读五本书只需几美分。开源权重Laya在微调后匹配或超过Jev的准确率,但需要更多设置。

"我们无法证明这不是补贴;我们需要长期来证明我们定价的可持续性(我们预期价格会下降,而非上升)。" – TypeSafe定价说明


当令牌比工具调用更便宜时

使用GPT-5.6 Luna($0.30/百万令牌)和典型MacBook Air(空闲10W,重负载30W)进行粗略计算:

工具 功率(W) 持续时间(秒) 成本(美分) 比Luna一轮便宜的数量级
grep 10 0.1 0.000007 4.5
HTML解析 10 1 0.00007 3.5
cargo build 30 30 0.00625 1.5

按当前费率,一次LLM调用很快将比一次简单的grep更便宜,这使得将模型嵌入传统工具链在经济上具有吸引力。


经济反作用力

供给侧的杰文斯悖论

更高的效率助长了诱导需求:AI提供商投资更多计算资源,因为每花费一美元能带来更高收入。这反映了经典的杰文斯悖论,即更便宜的电力刺激了更大的总体消费。

商业模式的可行性

批评者指出,仅靠廉价令牌并不能保证盈利能力。提供商仍依赖前沿模型的溢价定价、企业合同和基于量的服务。开源权重的竞争可能压缩利润,但硬件供应商(如NVIDIA)和专用推理服务将继续从规模中获利。


未来情景

  1. 无处不在的本地推理 – 在3-6年内,得益于内存高效架构(Mamba、4位量化)和MoE扩展,前沿质量模型预计能在普通硬件上运行。
  2. AI增强工具 – 随着令牌成本降至工具调用成本以下,开发者将用模型驱动的助手(如jgrep)取代临时脚本。构建调度器、安全扫描器和CI管道可能成为AI优先。
  3. 软件价值的转变 – 主要差异化因素将从原始功能转向质量、安全性和集成。具有高转换成本的传统SaaS产品将保持优势,而可塑的、AI生成的软件将在细分领域激增。

社区反应

"令牌变得比工具调用更便宜……我认为现在是引用斯坦定律的好时机:'如果某件事不能永远持续,它就会停止。'" – @jetrink

"帕累托图没有价值判断就毫无意义;'最具吸引力的象限'误导读者。" – @meatmanek

"能效图可以拟合许多趋势线;GPU每两年翻倍的说法需要更严格的统计支持。" – @empw

"如果推理继续商品化,硬件利润将缩小,利润将转向服务和专用芯片。" – @bryanlarsen

这些评论凸显了对永久指数趋势的怀疑、对基准可视化需谨慎解读的需求,以及对长期业务可持续性的担忧。


要点

硬件效率、模型架构进步和软件引擎优化的融合,使AI令牌成本在一年内下降了超过两个数量级。这使得令牌成本比许多传统计算原语更便宜,预示着AI将直接嵌入软件工具和基础设施的未来。

Sources

相关