沉没成本计算器显示本地 LLM 服务器需 44 年才能回本
核心结论:当前本地 LLM 服务器并不具备成本效益
沉没成本计算器表明,一台价值 3,499 美元的 Mac Studio M5 Max 运行 Qwen‑3.8 27B 模型,需要 44 年(约 79.7 亿个 token)才能在与最便宜的云 API 价格对比下实现回本。以目前每天节省 0.22 美元的水平,硬件成本在可预见的未来仍将是沉没成本。
回本计算方式
- 硬件成本:3,499 美元(Mac Studio M5 Max,64 GB 统一内存)。假设负载下的功耗为 145 W,基于上一代 M4 Max 的数据。
- 电费:0.17 美元/kWh(美国居民平均电价),连续运行每月电费为 0.26 美元。
- 本地推理速度:估算为每秒 25 个 token(约每天 214 万个输出 token)。该数值基于内存带宽计算,而非直接测量。
- API 成本:在 OpenRouter 上,Qwen‑3.8 27B 的输入成本为每百万 token 0.32 美元,输出成本为 2.50 美元。
- 每日 token 混合比例:总计 50 万个 token,输入与输出比例为 15:1(468,750 个输入,31,250 个输出)。
- 每日成本对比:
- 云服务:每天 0.23 美元。
- 本地运行:每天 0.01 美元(仅电费)。
- 节省:每天 0.22 美元。
- 回本时间:3,499 美元 / 0.22 美元 ≈ 15,942 天 ≈ 44 年,或处理 79.7 亿个 token。
"cloud_cost_per_day = (468,750 / 1,000,000 × $0.32) + (31,250 / 1,000,000 × $2.5) = $0.23" "local_cost_per_day = (31,250 / 24.7 tok/s / 3600) h × 145 W / 1000 × $0.17/kWh = $0.01"
模型能力与成本对比
- Qwen‑3.8 27B 在 Artificial Analysis Intelligence Index v4.3 上得分为 34,处于“Sonnet 级别”范围(介于 Claude Haiku 4.5 与 Claude Sonnet 5 之间)。其性能与主流开源模型相当,但仍落后于最新的专有模型。
- 该计算器将模型视为云端点的直接替代品;它不考虑无法在任何价格下本地运行的前沿模型(如 Claude Opus、GPT‑6)。
隐藏成本与收益
简单计算中常被忽略的成本
- 时间成本:本地推理速度约为每秒 25 个 token,而云 API 约为每秒 80 个 token,意味着一个 1,000 个 token 的回答在本地需 40 秒,在云端仅需 13 秒。每天处理 50 万个 token,这将带来约 15 分钟的等待时间。
- 提示词处理的电力消耗:计算器假设仅生成阶段耗电;提示词编码同样消耗电力。
- 空闲功耗:设备即使未生成 token 也会持续耗电。
- 转售价值:回本计算假设硬件成本完全沉没,未考虑潜在的转售或再利用价值。
- API 价格动态:假设价格不变;历史上云 API 价格持续下降,这将进一步延长回本周期。
可抵消货币亏损的收益
- 数据隐私:本地运行模型可避免将专有或敏感数据发送至第三方 API 的风险。
- 自主性:用户完全掌控模型版本、微调过程,可避免供应商锁定或审查。
- 多用途硬件:Mac Studio 还可用于渲染、游戏、移动应用构建或其他工作负载,使成本分摊至多个用途。
- 潜在收入:部分用户可出售计算时间或运行特殊服务(如企业级离线推理),这是云提供商无法提供的。
社区反馈
redox99:"数学错了;使用 MTP 和 Q8 KV 时,每秒 token 数应至少翻倍。即使吞吐量更高,这套设备也永远无法回本。在 OpenRouter 上卖 token 仍然无利可图。"
txrx0000:"拥有权比成本更重要。运行私有模型可防止 OpenAI/Anthropic 监视我的思想,并让我在无企业限制的情况下进行微调。"
ThunderSizzle:"Claude Code 每月费用超过 100 美元;我花了 1,350 美元购买 GPU,仅用约 4 个月就回本了,同时保持了数据私密性。"
jrflo:"以 API 速度的 25% 运行,44 年才能回本。本地模型适用于小型自动化任务,但不适合严肃的编码工作。"
mcone:"一台二手 HP Omen 搭载 3090 显卡,运行 Qwen‑3.8 可达每秒 57 个 token,相比 Mac Studio 的估算,回本时间大幅缩短。"
ProjectArcturis:"本地 LLM 的意义在于自主性,而非节省成本。你可以选择任何模型,进行微调,没人能拿走它。"
这些评论突显出两个反复出现的主题:(1) 技术假设对回本估算影响极大,以及 (2) 许多用户更看重隐私和控制,而非纯粹的成本节省。
你可以调整哪些参数?
该计算器允许你调整:
- 电费(例如地区电价、可再生能源费率)。
- 模型吞吐量(不同硬件、量化设置、MTP、KV 缓存优化)。
- API 价格趋势(开启“API 价格持续下降”以模拟未来降价)。
- 输入输出比例(更改 15:1 的假设会改变每日 token 上限)。
通过调整这些变量,可以发现某些特定场景下本地服务器可能实现微利——通常是在你拥有极低电费、高吞吐量硬件,或具备非货币价值(如隐私、转售、多用途使用)的情况下。
对潜在买家的总结建议
- 纯货币投资回报:在当前价格和典型消费级硬件下,本地 LLM 服务器需等待数十年才能回本。
- 何时考虑购买:如果你需要数据主权,希望避免供应商锁定,或已拥有用于其他工作负载的高端 GPU,那么隐藏收益可能超过财务损失。
- 如何改善计算结果:使用更强大的 GPU(如 RTX 4090、A6000)或多 GPU 服务器,降低电费,并考虑转售价值或替代工作负载,以缩短回本周期。
沉没成本计算器是一个有用的现实检验工具,但真正的决策取决于你对隐私、控制权以及多用途硬件价值的评估,而不仅仅是每 token 的美元成本对比。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch