Databricks AI 编码成本管理:可将支出降低 70% 的技术

核心要点

Databricks 通过(1)持续采用成本更低但能力相当的模型,(2)将请求路由到能完成任务的最低成本模型,(3)为开发者提供实时支出可见性与渐进式摩擦机制,以及(4)通过更智能的 harness 和缓存减少 token 开销,实现了 AI 编码成本降低约 70% 的同时,保持了高水平的开发人员生产力。


"效率前沿" 是主要节省来源

  • 定义 – 效率前沿是指在典型软件工程任务中,提供最佳性价比(每单位智能成本)的模型集合。它与仅关注原始能力的"前沿模型"概念不同。
  • 为何重要 – 大多数编码工作并不需要最高智能的模型;使用位于效率前沿的模型可大幅降低成本,而不会影响质量。
  • 行业观察 – Databricks、Stripe、Coinbase、Uber 和 Ramp 均报告称,新模型每周发布,推动效率前沿的演进速度远超原始能力的提升。

成本杠杆 #1 – 采用开源和低成本模型

  • 最大收益 – 切换到更新、更便宜的模型可带来最大的单次成本降幅。
  • 评估流水线 – 企业构建内部基准测试以反映其代码库;公开基准测试对编码任务而言不够充分。
  • Databricks 案例 – 内部基准测试显示 GLM 模型在性价比方面表现更优,从而推动了全公司范围的部署。
  • 负面案例 – Stripe 拒绝了 Opus 4.7,因其成本更高且质量无提升;Databricks 发现 Opus 5.0 到 4.8 存在性能退化。

Harness 与模型灵活性

  • 问题 – 专有模型通常与特定 harness 绑定,造成锁定。
  • 两种方法
    1. 要求用户切换 harness – 可行但会给开发者带来高摩擦。
    2. 使用元 harness – 提供统一 UI,同时将请求分发到任意底层 harness。Databricks 默认为开发者提供开源的 Omnigent 元 harness。
  • 结果 – 元 harness 保持了模型独立性,降低了切换成本。

成本杠杆 #2 – 动态请求与任务路由

  • 路由类别
    • 请求级路由 – 基于状态的代理(如 Unity AI Gateway Smart Router、Cursor Router、OpenRouter AutoRouter)将每个推理请求发送到能回答问题的最便宜模型,同时考虑缓存预热成本。
    • 任务级路由(元 harness) – 客户端根据任务复杂度决定使用哪个 harness;简单重命名任务发送到低成本模型,架构设计查询则发送到更强模型。Omnigent 实现了此模式。
    • 升级/委派 – 低成本的“工作者”模型处理大部分工作,仅在需要时升级到高智能模型(如 Claude 的 Advisor 工具、Cognition 的 Devin Fusion)。
  • 结果 – Databricks 报告 Smart Routing 实现了 >30% 的平均任务成本降低,且质量与池中最高成本模型相当。

成本杠杆 #3 – 可见性、触发器与渐进式预算

  • 硬性上限适得其反 – 切断 AI 访问会损害最高效的开发者,可能降低整体投资回报率。
  • 渐进式摩擦模型
    1. 可见性 – 实时仪表板显示每位开发者的支出,并建议更便宜的模型替代方案。
    2. 支出门限 – 低阈值时自动清除警告;高阈值需经理批准。
    3. 降级 – 触发门限后,系统自动将开发者切换到更低成本模型,而非暂停访问。
    4. 暂停 – 仅在极端超支时作为最后手段使用。
  • 行业共识 – 所有受访公司(Databricks、Stripe、Uber 等)均采用某种形式的可见性 + 渐进式门限。

成本杠杆 #4 – 减少 token 开销

  • 上下文膨胀主导成本 – 开发者的提示仅占总 token 的极小部分;大多数 token 来自自动收集的代码上下文、工具输出和系统提示。
  • 实用技术
    • 强制更频繁地进行上下文 压缩/缩减
    • 选择或调整 harness 使其更“简洁”(生成更少 token)。
    • 审计并精简冗长的工具调用。
    • 鼓励开发者将大任务拆分为小单元,限制上下文大小。
  • 提示缓存 – 启用 KV 缓存读取重复上下文;调整缓存写入频率以平衡成本与命中率。
  • Databricks 结果 – 简单的 harness 和缓存调优使生成 token 量减少约 50%,且无质量损失。

AI 网关设计模式

  • 为何需要网关 – 集中管理模型选择、预算执行、配置和日志记录。
  • 核心职责
    1. 容量管理与代理 – 将流量路由到专有或开源模型。
    2. 预算跟踪与渐进策略 – 实现支出门限、降级和暂停功能。
    3. 配置管理 – 强制执行模型白名单、压缩设置及其他工具级策略。
    4. 可观测性 – 记录会话追踪,用于下游效率分析。
  • Databricks 实现Unity AI Gateway 提供全部四项能力,且作为免费或开源产品提供。

社区反馈总结

  • 积极反响 – 评论者称赞其务实、以实现为导向的语气,并指出许多公司正趋同于类似的工具链。
  • 对成本爆炸的怀疑 – 部分用户(如 @lbriner)质疑该问题是否真实存在或仅为预防性担忧;但多位受访者确认在缺乏控制时存在真实世界中的支出激增。
  • 模型商品化 – @dgellow 指出,路由机制使模型选择成为商品,迫使 AI 实验室持续提升性价比。
  • 评估挑战 – @bisonbear 警告称,若无领域特定基准,路由决策可能有风险;该观点与 Databricks 强调内部评估流水线一致。
  • token 效率的重要性 – @wxw 和 @lubujackson 强调上下文控制和工具调用修剪是“低垂的果实”,呼应了杠杆 #4。
  • 实际关切 – @DenisM 询问 Smart Router 如何提升任务完成率;答案在于仅在必要时选择最强模型,从而在保持质量的同时降低平均成本。
  • 开源好奇 – @sellmethepen 和 @aliasxneo 询问可用性;Unity AI Gateway 和 Omnigent 均作为免费或开源组件发布。

给工程领导者的建议

  1. 优先考虑效率前沿 – 定期将新的开源和商业模型与内部工作负载进行基准测试。
  2. 部署元 harness – 使用 Omnigent 或自定义层,使开发者对底层模型无感知。
  3. 实施智能路由 – 在请求、任务或升级级别进行路由,以在保持峰值性能的同时将平均支出保持在低位。
  4. 提供开发者支出可见性 – 实时仪表板和渐进式门限可在不抑制生产力的前提下防止意外超支。
  5. 削减 token 浪费 – 优化上下文大小、harness 冗余度和缓存设置;即使小幅减少也能带来显著的美元节省。
  6. 通过 AI 网关实现集中化 – 在单一代理服务中整合模型访问、预算管理和可观测性。

遵循此操作手册,组织可在享受 AI 辅助编码带来的生产力提升的同时,保持成本可控且可持续。

Sources

相关