Tokenomics: 量化智能体软件工程中的 Token 消耗
智能体软件工程的主要成本是优化,而非生成
针对基于 LLM 的多智能体 (LLM-MA) 系统的研究表明,自动化软件工程中最重要的资源支出发生在迭代优化和验证阶段。根据研究报告《Tokenomics: Quantifying Where Tokens Are Used in Agentic Software Engineering》,代码审查 (Code Review) 阶段平均占用了总 Token 消耗的 59.4%。
这一发现将人们对智能体成本的理解从最初的代码创建转向了确保代码正确且功能完备所需的开销。这表明,智能体软件工程在实际应用中的主要瓶颈并非模型的生成能力,而是智能体所使用的协作与验证协议的低效性。
Token 在 SDLC 中的分布
为了量化这些成本,研究人员分析了使用 GPT-5 推理模型执行的 ChatDev 框架完成的 30 个软件开发任务的执行轨迹。该研究将内部智能体阶段映射到由设计 (Design)、编码 (Coding)、代码补全 (Code Completion)、代码审查 (Code Review)、测试 (Testing) 和文档 (Documentation) 组成的标准化软件开发生命周期 (SDLC) 框架中。
关键消耗指标
- 主导阶段: 代码审查 (Code Review) 是最昂贵的阶段,消耗了近 60% 的所有 Token。
- 输入与输出: 输入 Token 一直占据消耗的最大份额,平均为 53.9%。
- 资源重心: 数据表明,智能体软件工程的成本严重向自动化优化和验证倾斜,而非最初的代码草拟。
智能体协作中的低效性
输入 Token 的高比例 (53.9%) 为智能体如何通信和处理信息的方式中的低效性提供了实证证据。在多智能体系统中,智能体通常会重新阅读大量的上下文或整个代码库来做出微小的调整。
社区中的从业者也对此表示认同。一位开发者指出,在其自身经验中,输入与输出的比率显著更高:
我在我的使用中看到了大约 10:1 的比例……智能体经常会为了修复一行代码而阅读一百万个 Token。
这种模式表明,当前的智能体工作流是“Token 重度型”的,即提供上下文的成本远超生成实际解决方案的成本。
经济与运营影响
Token 消耗的不可预测性为 AI 集成软件工具的商业可行性带来了重大障碍。由于 Token 使用量在迭代审查周期中可能会激增,公司很难为这些工具进行准确的预算编制。
市场可持续性与定价
社区讨论突出了人们对 Token 定价的随意性和 AI 许可缺乏透明度的日益增长的担忧。一些用户报告称,在定价更新后,Token 可用性发生了剧烈变化,这引发了人们对当前的 AI 商业模式对供应商和客户而言在经济上可能都不可持续的怀疑。
向 Token 优化转向
随着运行这些系统的成本变得越来越明显,工程需求预计将会发生转变。正如早期的基础设施工程师因其优化硬件和网络效率的能力而受到重视一样,未来的软件工程师可能会根据其优化 AI 智能体“Token 效率”的能力来衡量,以减少运营开销和环境影响。