LLM 价值前沿:分析性能与 API 成本

LLM 价值前沿:每美元最大化智能

寻找最优的大型语言模型(LLM)通常需要在原始能力与 API 成本之间取得平衡。"价值前沿"代表了那些没有更便宜的替代模型能提供同等或更高智能的模型集合。根据截至 2026 年 9 月 24 日的人工分析智能指数(Artificial Analysis Intelligence Index)数据,当前市场被划分为不同的预算层级,少数模型主导了效率曲线。

按预算层级划分的最佳模型

对于在特定价格约束下追求最高智能的用户,以下模型目前定义了价值前沿。价格基于每 100 万 token 的混合成本(使用 3:1 的输入输出比例)。

高预算层级(每 100 万 token 超过 $8.00)

Claude Opus 5.5 是当前在原始智能方面领先的模型,其得分为 57.6,混合成本为每 100 万 token $8.00。它是目前最强大的模型,显著优于第二名 Claude Fable 5.1(得分为 53.4,成本为每 100 万 token $20.00)。

中等预算层级(每 100 万 token $0.54 至 $8.00)

  • $2.00 至 $8.00: Muse Spark 1.3 提供最佳性价比,得分为 48.1,成本为每 100 万 token $2.00。GPT-6 Sol(得分为 47.5,成本为每 100 万 token $4.00)是主要的第二选择。
  • $0.54 至 $2.00: MiMo-V2.6-Pro 在此细分市场中领先,得分为 46.3,成本为每 100 万 token $0.54,其次是 Step 5 Preview(得分为 43.7,成本为每 100 万 token $1.43)。

低预算层级(每 100 万 token 低于 $0.54)

  • $0.24 至 $0.54: GLM 5.3 Flash 是最佳选择,得分为 41.8,成本为每 100 万 token $0.24。
  • $0.23 至 $0.24: Qwen3.8-Flash-Next 提供了一个狭窄的价值窗口,得分为 39.8,成本为每 100 万 token $0.23。
  • 低于 $0.23: GPT-6 Luna 是最高效的入门级模型,得分为 37.3,成本为每 100 万 token $0.20。

原始能力排名

当忽略成本时,智能指数识别出无论价格如何表现最佳的模型。按原始能力排名前五的模型为:

  1. Claude Opus 5.5:57.6
  2. Claude Fable 5.1:53.4
  3. GPT-6 Astra:52.7
  4. Claude Opus 5:50.8
  5. Claude Fable 5:49.6

关键分析与局限性

尽管价值前沿为成本效率提供了一个基准,但社区讨论指出了这种方法衡量 LLM 价值的几个关键局限性。

token 成本 vs. 任务成本

多位贡献者认为,每 token 成本是一个过于简单的指标,因为不同模型完成相同结果所需的 token 数量不同。

"某些模型可能需要 2-3 倍的 token 数量才能达到相同的智能水平。人工分析自身的每任务成本才是对成本更公平的估算。"

订阅制 vs. API 定价

该分析仅关注 API 成本,这可能无法反映大多数依赖补贴月度订阅的个人用户的实际支出情况。

"直接购买 codex 或 chat gpt 订阅要便宜约 10 倍……我确信在订阅计划下使用前沿模型会比支付 DeepSeek Flash 的 API 价格更便宜。"

本地执行替代方案

对于拥有足够硬件(例如 24-64GB RAM 的 Mac)的用户,本地运行模型(如 Qwen3.8 27B)可以作为 API 成本的可行替代方案。用户报告成功使用量化版本(例如 IQ3_S)执行整夜任务,如调试原生 Mac Swift 应用程序。

定性性能差距

定量得分往往无法捕捉到诸如“啰嗦”、“愿意放弃”或在复杂编码任务中“提前思考”的细微行为。例如,DeepSeek V4.1 Flash 被指出在解决问题时“毫不妥协”,即使解决方案可能效率不高,这种特质无法通过单一智能得分体现。

Sources

相关