使用 GLM 5.3 Flash 编码的一个月——关于成本、能源和基础设施的经验教训
TL;DR
Wagtail 花了一个月的时间尝试完全使用 GLM 5.3 Flash;前半个月保持在预算内(68 美元,约 4 kWh,365 g CO₂),但后半个月转向了其他模型,额外消耗了 10 亿个 token,使总能耗增加到约 35 kWh。该实验证明,模型选择、智能体模式和提供商容量直接影响成本和碳足迹。
实验旨在证明什么
团队的目标是在 2026 年 9 月期间所有 AI 驱动的编码工作都使用 GLM 5.3 Flash——这是一款闪电级(flash-tier)、开放权重模型,具有 100 万 token 上下文窗口、视觉支持和广泛的提供商可用性。成功将证明单一的高效模型可以处理大部分生产和研发任务,同时保持低支出和低排放。
实际发生了什么
前半个月:以模型为中心的成功
- 预算合规 – 支出 68 美元,消耗约 4 kWh 电力,排放 365 g CO₂。
- 任务覆盖 – UI 工作、AI 研发、文档编写和代码评估均在 GLM 5.3 Flash 上运行。
- 性能亮点 – 大上下文窗口允许进行长时间的编码会话;视觉能力使模型能够解读屏幕截图。
后半个月:意外的 token 漂移
- Token 外溢 – 10 亿个 token(约占当月总量的 50%)被路由到其他模型,如 DeepSeek V4.1 Flash 和 Qwen 3.8 Flash。
- 成本升级 – 这种漂移在一天之内增加了 150 美元和约 5 kWh 的能源消耗,原因是一个原型使用了“错误”的模型来构建 vibe-coded MCP 服务器。
- 基础设施瓶颈 – 流行的推理提供商限制了 GLM 5.3 Flash 的使用,迫使回退到替代模型。
发现的关键痛点
1. 模型选择比你想象的更重要
"我们几乎在一夜之间消耗了 4.5 亿个 token / 150 美元 / 5 kWh,因为我们为原型选择了错误的模型。" – ThibWeb
- 选择不适合智能体工作流的模型会导致 token 爆炸。
- 团队估计,一个 5 倍更便宜 的替代方案本可以用少得多的支出实现类似的结果。
2. 提供商容量限制影响可靠性
- GLM 5.3 Flash 处于成本性能的 帕累托前沿 附近,使其成为共享推理集群的高需求目标。
- 容量短缺表现为延迟降低和被迫切换模型,尽管该模型在许多提供商处均有提供。
3. 能源成本报告并非易事
- 该实验依赖于提供商提供的指标(例如 NeuralWatt 的能源估算)。一些评论者质疑这些数字的真实性,指出利润率可能已计入报告的 kWh 中。
- 对 token 使用量和功耗进行准确的本地测量对于真正的预算编制至关重要。
社区见解
- 能源惊喜 – 一位评论者强调,4 kWh 仅占货币成本的 1%,相当于驾驶电动汽车行驶约 15 英里,这凸显了报告的能源足迹相对于预期是多么低。
- 指标批评 – 其他人指出,每 token 成本图表可能会产生误导,因为模型在 token 效率和速度上存在差异。诸如 每任务时间 和 每任务成本 之类的替代指标可能更具可操作性。
- 特定模型定价 – 由于卓越的缓存机制,DeepSeek 的 API 可能比第三方聚合器更便宜,而 GLM 5.3 Flash 的定价在不同提供商之间(例如 Z-AI 与 NeuralWatt)有所不同。
- 智能体工作流技巧 – 成功的从业者将闪电级模型与专门的规划和审查智能体(例如用于规划的 Astra-Low,用于审查的 SOL 6.1-Medium)配对,以提高可靠性。
GLM 5.3 Flash 的优势
- 100 万 token 上下文窗口 – 能够在不进行分块的情况下处理大型代码库。
- 视觉能力 – 允许模型处理屏幕截图和视觉 QA。
- 跨提供商可用性 – 鼓励竞争和价格套利。
- 多功能性 – 该模型处理了 UI 任务、编码、文档和评估,没有出现重大性能下降。
具体收获和后续步骤
- 实施持续的本地测量:测量 token、成本和能源,以便及早发现峰值。
- 为实验分配专门预算:与日常生产分开,确保原型根据成本约束进行评估。
- 优化多智能体编排:定义明确的角色(编排者、侦察员、执行者、审查者)和有界目标,以避免 token 使用失控。
- 优先考虑高效模型:目标是让大部分推理工作在闪电级模型上运行,通过成本/能源而非原始 token 数量来衡量成功。
- 监控提供商容量:构建回退策略并跟踪延迟趋势,以预先防止被迫切换模型。
最终结论
为期一个月的挑战在保持所有工作在 GLM 5.3 Flash 上运行方面 仅成功了 50%,但它提供了关于模型选择、智能体设计和基础设施限制如何驱动实际成本的宝贵数据。通过加强测量、预算和编排,Wagtail 计划将闪电级模型作为其 10 月 AI 工作流的支柱。
参加 11 月的 Wagtail Space 2026 讨论,看看这些经验教训如何转化为实践。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch