Databricks AI 編碼成本管理:可降低支出 70% 的技術

核心重點

Databricks 透過 (1) 持續採用成本更低但效能相當的模型、(2) 將請求導向能完成任務的最低成本模型、(3) 給予開發者即時支出可視性與逐步增加的摩擦、以及 (4) 透過更智慧的 harness 與快取技術減少 token 開銷,成功將 AI 編碼成本降低約 70%,同時維持高開發者生產力。


「效率邊界」帶來大多數節省

  • 定義 – 效率邊界是指在典型軟體工程任務中,提供最佳「每單位智慧成本」的模型集合。這與僅追求原始能力的「前沿模型」概念不同。
  • 重要性 – 大多數編碼工作並不需要最高智慧的模型;使用位於效率邊界的模型,可大幅降低成本而不影響品質。
  • 產業觀察 – Databricks、Stripe、Coinbase、Uber 和 Ramp 均表示,新模型每周發布的速度,已超過原始能力進步對邊界推移的影響。

成本槓桿 #1 – 採用開源與低成本模型

  • 最大效益 – 切換至更新、更便宜的模型,可帶來單一數字級別的最大成本降低。
  • 評估流程 – 公司建立內部基準測試,反映其程式碼庫特性;公開基準對編碼任務而言不夠充分。
  • Databricks 範例 – 內部基準顯示 GLM 模型具備更優異的價效比,促使公司全面推廣。
  • 負面案例 – Stripe 因 Opus 4.7 成本更高且品質無提升而拒絕採用;Databricks 則發現 Opus 5.0 到 4.8 出現退化現象。

Harness 與模型彈性

  • 問題 – 專有模型通常與特定 harness 綁定,造成鎖定效應。
  • 兩種做法
    1. 要求使用者切換 harness – 雖可行,但對開發者造成高摩擦。
    2. 使用 meta-harness – 提供統一 UI,同時可調度任何底層 harness。Databricks 為開發者預設採用開源的 Omnigent meta-harness。
  • 成果 – meta-harness 保留模型獨立性,並降低切換成本。

成本槓桿 #2 – 動態請求與任務導向

  • 導向類別
    • 請求層級導向 – 狀態感知代理(如 Unity AI Gateway Smart Router、Cursor Router、OpenRouter AutoRouter)將每個推論請求導向最便宜且能回答問題的模型,同時考慮快取預熱成本。
    • 任務層級導向(meta-harness) – 客戶端根據任務複雜度決定使用哪個 harness;簡單的重命名任務導向低成本模型,架構設計提問則導向強力模型。Omnigent 實作了此模式。
    • 升級/委派 – 由低成本「工作者」模型處理大部分工作,僅在必要時升級至高智慧模型(如 Claude 的 Advisor Tool、Cognition 的 Devin Fusion)。
  • 結果 – Databricks 報告 Smart Routing 平均任務成本降低超過 30%,且品質與池中最高價模型相當。

成本槓桿 #3 – 可視性、觸發機制與逐步預算

  • 硬性上限反效果 – 切斷 AI 存取會損害最高效能的開發者,可能降低整體投資報酬率。
  • 逐步摩擦模型
    1. 可視性 – 即時儀表板顯示每位開發者的支出,並建議成本更低的模型替代方案。
    2. 支出門檻 – 在低門檻設置自動清除警告;高門檻則需經經理批准。
    3. 降級 – 當觸發門檻時,系統自動將開發者切換至低成本模型,而非停用存取。
    4. 停用 – 僅在極端超支時作為最後手段使用。
  • 產業共識 – 所有受訪公司(Databricks、Stripe、Uber 等)皆使用某種形式的可視性 + 逐步門檻機制。

成本槓桿 #4 – 減少 token 開銷

  • 上下文膨脹主導成本 – 開發者的提示僅佔總 token 的極小部分;大多數 token 來自自動收集的程式碼上下文、工具輸出與系統提示。
  • 實用技術
    • 強制更頻繁地進行上下文 壓縮/精簡
    • 選擇或調整 harness,使其「較少閒聊」(產生較少的 token)。
    • 審計並修剪冗長的工具呼叫。
    • 鼓勵開發者將大型任務拆分成小單位,以限制上下文大小。
  • 提示快取 – 啟用 KV 快取讀取重複上下文;調整快取寫入頻率,以平衡成本與命中率。
  • Databricks 成果 – 單純的 harness 與快取調校,使產生的 token 減少約 50%,且品質無損。

AI Gateway 設計模式

  • 為何需要 Gateway – 統一管理模型選擇、預算執行、設定與記錄。
  • 核心職責
    1. 容量管理與代理 – 將流量路由至專有或開源模型。
    2. 預算追蹤與逐步政策 – 實作支出門檻、降級與停用機制。
    3. 設定管理 – 強制執行模型允許清單、壓縮設定及其他工具政策。
    4. 可觀察性 – 記錄會話追蹤,供後續效率分析使用。
  • Databricks 實作Unity AI Gateway 提供全部四項功能,並以免費或開源形式提供。

社群反饋綜合

  • 正面回應 – 評論者讚揚其務實、以實作為導向的語氣,並指出許多企業正趨向採用類似工具。
  • 對成本爆炸的懷疑 – 部分使用者(如 @lbriner)質疑問題是否真實存在或只是預防性;但多位回應者確認,若無管控,現實中確實會出現支出激增。
  • 模型商品化 – @dgellow 強調,導向機制使模型選擇成為商品,迫使 AI 實驗室持續提升價效比。
  • 評估挑戰 – @bisonbear 警告,若缺乏領域特定基準,導向決策可能有風險;此觀點與 Databricks 強調內部評估流程一致。
  • token 效率的重要性 – @wxw 與 @lubujackson 強調,上下文控制與工具呼叫修剪是低垂的果實,呼應槓桿 #4。
  • 實務疑問 – @DenisM 詢問 Smart Router 如何提升任務完成率;答案在於僅在必要時選擇最強模型,以維持品質同時降低平均成本。
  • 開源好奇 – @sellmethepen 與 @aliasxneo 詢問可用性;Unity AI Gateway 與 Omnigent 均以免費或開源形式釋出。

給工程領導者的啟示

  1. 優先考量效率邊界 – 定期將新開源與商業模型與內部工作負載進行基準測試。
  2. 部署 meta-harness – 使用 Omnigent 或自訂層,讓開發者對底層模型無感。
  3. 實作智慧導向 – 在請求、任務或升級層級導向,以維持高品質同時將平均支出降至最低。
  4. 提供開發者支出可視性 – 即時儀表板與逐步門檻可防止意外超支,且不抑制生產力。
  5. 消除 token 浪費 – 優化上下文大小、harness 的冗長性與快取設定;即使小幅減少,也能帶來顯著的金錢節省。
  6. 以 AI Gateway 中央化 – 將模型存取、預算與可觀察性整合至單一代理服務中。

遵循此策略,組織可在享受 AI 助力編碼帶來的生產力提升之餘,也確保成本範圍可預測且可永續。

Sources

相關