Databricks AI 编码成本管理:可将支出降低 70% 的技术
核心要点
Databricks 通过(1)持续采用成本更低但能力相当的模型,(2)将请求路由到能完成任务的最低成本模型,(3)为开发者提供实时支出可见性与渐进式摩擦机制,以及(4)通过更智能的 harness 和缓存减少 token 开销,实现了 AI 编码成本降低约 70% 的同时,保持了高水平的开发人员生产力。
"效率前沿" 是主要节省来源
- 定义 – 效率前沿是指在典型软件工程任务中,提供最佳性价比(每单位智能成本)的模型集合。它与仅关注原始能力的"前沿模型"概念不同。
- 为何重要 – 大多数编码工作并不需要最高智能的模型;使用位于效率前沿的模型可大幅降低成本,而不会影响质量。
- 行业观察 – Databricks、Stripe、Coinbase、Uber 和 Ramp 均报告称,新模型每周发布,推动效率前沿的演进速度远超原始能力的提升。
成本杠杆 #1 – 采用开源和低成本模型
- 最大收益 – 切换到更新、更便宜的模型可带来最大的单次成本降幅。
- 评估流水线 – 企业构建内部基准测试以反映其代码库;公开基准测试对编码任务而言不够充分。
- Databricks 案例 – 内部基准测试显示 GLM 模型在性价比方面表现更优,从而推动了全公司范围的部署。
- 负面案例 – Stripe 拒绝了 Opus 4.7,因其成本更高且质量无提升;Databricks 发现 Opus 5.0 到 4.8 存在性能退化。
Harness 与模型灵活性
- 问题 – 专有模型通常与特定 harness 绑定,造成锁定。
- 两种方法
- 要求用户切换 harness – 可行但会给开发者带来高摩擦。
- 使用元 harness – 提供统一 UI,同时将请求分发到任意底层 harness。Databricks 默认为开发者提供开源的 Omnigent 元 harness。
- 结果 – 元 harness 保持了模型独立性,降低了切换成本。
成本杠杆 #2 – 动态请求与任务路由
- 路由类别
- 请求级路由 – 基于状态的代理(如 Unity AI Gateway Smart Router、Cursor Router、OpenRouter AutoRouter)将每个推理请求发送到能回答问题的最便宜模型,同时考虑缓存预热成本。
- 任务级路由(元 harness) – 客户端根据任务复杂度决定使用哪个 harness;简单重命名任务发送到低成本模型,架构设计查询则发送到更强模型。Omnigent 实现了此模式。
- 升级/委派 – 低成本的“工作者”模型处理大部分工作,仅在需要时升级到高智能模型(如 Claude 的 Advisor 工具、Cognition 的 Devin Fusion)。
- 结果 – Databricks 报告 Smart Routing 实现了 >30% 的平均任务成本降低,且质量与池中最高成本模型相当。
成本杠杆 #3 – 可见性、触发器与渐进式预算
- 硬性上限适得其反 – 切断 AI 访问会损害最高效的开发者,可能降低整体投资回报率。
- 渐进式摩擦模型
- 可见性 – 实时仪表板显示每位开发者的支出,并建议更便宜的模型替代方案。
- 支出门限 – 低阈值时自动清除警告;高阈值需经理批准。
- 降级 – 触发门限后,系统自动将开发者切换到更低成本模型,而非暂停访问。
- 暂停 – 仅在极端超支时作为最后手段使用。
- 行业共识 – 所有受访公司(Databricks、Stripe、Uber 等)均采用某种形式的可见性 + 渐进式门限。
成本杠杆 #4 – 减少 token 开销
- 上下文膨胀主导成本 – 开发者的提示仅占总 token 的极小部分;大多数 token 来自自动收集的代码上下文、工具输出和系统提示。
- 实用技术
- 强制更频繁地进行上下文 压缩/缩减。
- 选择或调整 harness 使其更“简洁”(生成更少 token)。
- 审计并精简冗长的工具调用。
- 鼓励开发者将大任务拆分为小单元,限制上下文大小。
- 提示缓存 – 启用 KV 缓存读取重复上下文;调整缓存写入频率以平衡成本与命中率。
- Databricks 结果 – 简单的 harness 和缓存调优使生成 token 量减少约 50%,且无质量损失。
AI 网关设计模式
- 为何需要网关 – 集中管理模型选择、预算执行、配置和日志记录。
- 核心职责
- 容量管理与代理 – 将流量路由到专有或开源模型。
- 预算跟踪与渐进策略 – 实现支出门限、降级和暂停功能。
- 配置管理 – 强制执行模型白名单、压缩设置及其他工具级策略。
- 可观测性 – 记录会话追踪,用于下游效率分析。
- Databricks 实现 – Unity AI Gateway 提供全部四项能力,且作为免费或开源产品提供。
社区反馈总结
- 积极反响 – 评论者称赞其务实、以实现为导向的语气,并指出许多公司正趋同于类似的工具链。
- 对成本爆炸的怀疑 – 部分用户(如 @lbriner)质疑该问题是否真实存在或仅为预防性担忧;但多位受访者确认在缺乏控制时存在真实世界中的支出激增。
- 模型商品化 – @dgellow 指出,路由机制使模型选择成为商品,迫使 AI 实验室持续提升性价比。
- 评估挑战 – @bisonbear 警告称,若无领域特定基准,路由决策可能有风险;该观点与 Databricks 强调内部评估流水线一致。
- token 效率的重要性 – @wxw 和 @lubujackson 强调上下文控制和工具调用修剪是“低垂的果实”,呼应了杠杆 #4。
- 实际关切 – @DenisM 询问 Smart Router 如何提升任务完成率;答案在于仅在必要时选择最强模型,从而在保持质量的同时降低平均成本。
- 开源好奇 – @sellmethepen 和 @aliasxneo 询问可用性;Unity AI Gateway 和 Omnigent 均作为免费或开源组件发布。
给工程领导者的建议
- 优先考虑效率前沿 – 定期将新的开源和商业模型与内部工作负载进行基准测试。
- 部署元 harness – 使用 Omnigent 或自定义层,使开发者对底层模型无感知。
- 实施智能路由 – 在请求、任务或升级级别进行路由,以在保持峰值性能的同时将平均支出保持在低位。
- 提供开发者支出可见性 – 实时仪表板和渐进式门限可在不抑制生产力的前提下防止意外超支。
- 削减 token 浪费 – 优化上下文大小、harness 冗余度和缓存设置;即使小幅减少也能带来显著的美元节省。
- 通过 AI 网关实现集中化 – 在单一代理服务中整合模型访问、预算管理和可观测性。
遵循此操作手册,组织可在享受 AI 辅助编码带来的生产力提升的同时,保持成本可控且可持续。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch