本地 LLM vs. API 成本:Apple Silicon 真的是更便宜嗎?
關於是要自行託管大型語言模型 (LLM) 還是依賴 API 提供商的爭論,通常被框架為便利性與成本之間的選擇。傳統觀點認為,硬體的高昂前期成本使得本地託管對大多數人來說昂貴得令人望而卻步。然而,Rohan Sood 最近的一項分析指出,當你考慮到現實世界的用法模式和硬體折舊時,敘事會從「本地更貴」轉變為「視情況而定」。
重新思考成本方程式
許多關於本地託管與 OpenRouter 等 API 服務之間的成本比較都失敗了,因為它們依賴於過於簡單的指標。Sood 主張,先前的分析往往只專注於輸出 token,忽略了 LLM 在實際生產或開發環境中如何使用的關鍵細微差別。
為了獲得更準確的圖像,Sood 在配備 128GB RAM 的 M4 Max 上進行了基準測試,重點關注通常會使計算向 API 傾斜的三個主要因素:
- 輸入-輸出 Token 比率:現實世界的負載,特別是對於程式碼代理 (coding agents),通常具有很高的輸入與輸出比率(例如 4:1 或 5:1)。由於許多 API 對輸入和輸出 token 的收費方式不同,忽略輸入量會導致不準確的成本預測。
- 批次處理與並行性:利用
vllm等工具進行批次處理和快取,可以顯著提高 token 吞吐量。對於那些運行多個程式碼代理或複雜工作樹的人來說,並行性帶來的性能增益是巨大的。 - 剩餘硬體價值:與每月的 API 訂閱不同,MacBook Pro 是一項有形的資產。Sood 指出,可以合理地預期在三到五年後仍有 1,500 美元到 2,500 美元的轉售價值,這有效地降低了總持有成本 (TCO)。
基準測試結果
使用並行度為 4 的程式碼代理負載近似值,基準測試揭示了根據所使用的模型架構而產生的顯著差異。
密集型模型 (Gemma 4 31B)
對於像 Gemma 4 31B 這樣的密集型模型,成本差異很小。本地推理的混合成本約為 每百萬 token 約 $0.14,而 OpenRouter 的成本為 每百萬 $0.16。在五年的時間線上,這代表了大約 13-14% 的節省。
MoE 模型 (Gemma 4 26B)
在使用混合專家模型 (MoE) 時,優勢變得更加明顯。由於 MoE 模型在推理期間的計算效率更高,吞吐量會大幅增加。
對於 Gemma 4 26B,本地混合成本降至 每百萬 token 約 $0.038,而 OpenRouter 的成本約為 每百萬 $0.1。這代表了向本地託管傾斜的近 3 倍 (65%) 成本降低。
本地 LLM 的戰略意義
雖然密集型模型的財務收益可能很小,但經濟敘事的轉變至關重要。支持本地 LLM 的論點超出了單純的 token 成本:
- 隱私與安全:本地託管消除了將敏感程式碼或專有數據發送給第三方提供商的需求。
- GPU 供應限制:隨著 GPU 供應波動以及獲取高端運算資源變得更具競爭力,擁有硬體可以提供保證的可用性基準。
- 可預測的支出:本地託管將營運支出 (OpEx) 轉換為資本支出 (CapEx),消除了 API 價格突然上漲或速率限制的風險。
結論
正如 Sood 所承認的,這些基準測試是合成的,並且是基於有關電力成本和硬體壽命的特定假設。並非每個用戶都會為了推理而讓其 MacBook Pro 24/7 全天候運行五年。然而,數據表明,對於重度用戶——特別是那些利用 MoE 模型和高並行工作負載的人——Apple Silicon 並不僅僅是 API 的可行替代方案,而且在經濟上可能是一個更優越的選擇。