本地 LLM 对比 API 成本:Apple Silicon 真的更便宜吗?
关于是自托管大语言模型 (LLM) 还是依赖 API 提供商的争论,通常被视为便利性与成本之间的权衡。传统观点认为,硬件的高昂前期成本使得本地托管对大多数人来说过于昂贵。然而,Rohan Sood 最近的一项分析表明,如果考虑到实际的使用模式和硬件折旧,这种说法就会从“本地更贵”转变为“视情况而定”。
重新思考成本方程
许多关于本地托管与 OpenRouter 等 API 服务之间的成本比较都失败了,因为它们依赖于过于简单的指标。Sood 认为,之前的分析往往只关注输出 token,忽略了 LLM 在生产或开发环境中实际使用的关键细微差别。
为了获得更准确的图景,Sood 在一台配备 128GB RAM 的 M4 Max 上进行了基准测试,重点关注通常会使 API 在数学计算上占优的三个主要因素:
- 输入-输出 Token 比例:实际的工作负载,特别是对于编程智能体 (coding agents),通常具有较高的输入与输出比例(例如 4:1 或 5:1)。由于许多 API 对输入和输出 token 的收费方式不同,忽略输入量会导致成本预测不准确。
- 批处理与并发:利用
vllm等工具进行批处理和缓存可以显著提高 token 吞吐量。对于那些运行多个编程智能体或复杂工作树的用户来说,并发带来的性能提升是巨大的。 - 剩余硬件价值:与按月支付的 API 订阅不同,MacBook Pro 是一项实实在在的资产。Sood 指出,可以合理地预期在三到五年后仍有 1,500 美元到 2,500 美元的转售价值,这有效地降低了总拥有成本 (TCO)。
基准测试结果
使用并发度为 4 的编程智能体工作负载近似值进行测试,基准测试显示出根据所使用的模型架构而产生的显著差异。
稠密模型 (Gemma 4 31B)
对于像 Gemma 4 31B 这样的稠密模型,成本差异很小。本地推理的混合成本约为 每百万 token 0.14 美元,而 OpenRouter 的成本为 每百万 token 0.16 美元。在五年的时间跨度内,这代表了大约 13-14% 的节省。
MoE 模型 (Gemma 4 26B)
在使用混合专家模型 (MoE) 时,优势变得更加显著。由于 MoE 模型在推理过程中计算效率更高,吞吐量会大幅增加。
对于 Gemma 4 26B,本地混合成本降至 每百万 token 0.038 美元,而 OpenRouter 的成本约为 每百万 token 0.1 美元。这代表了本地托管在成本上近 3 倍(65%)的降幅。
本地 LLM 的战略意义
虽然稠密模型的财务优势可能并不显著,但经济叙事的转变至关重要。支持本地 LLM 的论点超出了单纯的每个 token 的成本:
- 隐私与安全:本地托管消除了将敏感代码或专有数据发送给第三方提供商的需求。
- GPU 供应限制:随着 GPU 供应波动以及获取高端算力的竞争日益激烈,拥有硬件可以提供保障的可用性基准。
- 可预测的支出:本地托管将运营成本 (OpEx) 转换为资本支出 (CapEx),消除了 API 价格突然上涨或速率限制的风险。
结论
正如 Sood 所承认的,这些基准测试是合成的,并且基于关于电力成本和硬件寿命的特定假设。并非每个用户都会在五年内 24/7 全天候运行 MacBook Pro 进行推理。然而,数据表明,对于重度用户——特别是那些利用 MoE 模型和高并发工作负载的用户——Apple Silicon 不仅仅是 API 的可行替代方案,而且在经济上可能是一个更优的选择。