Qwen 3.8 Max 登顶 Artificial Analysis Agentic Index —— 这意味着什么

Qwen 3.8 Max 现已领跑 Agentic Index

核心观点: Qwen 3.8 Max 在 Artificial Analysis 的 Agentic Index 中排名第一,得分最高,这表明它在衡量工具使用、规划和自主问题解决能力的基准测试中优于其他前沿模型。

该排名基于九项专注于智能体(agentic)的评估指标的加权平均值(GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR)。得分越高,意味着在这些任务中的表现越出色。


Agentic Index 的运作原理

核心观点: 该指数结合了性能、速度和成本,为每个模型生成单一的智能评分。

  • 智能组件 – 对九项智能体基准测试的得分进行归一化和加权处理。
  • 速度组件 – 以每秒输出的 token 数进行衡量;越高越好。
  • 成本组件 – 每个智能指数任务的加权平均美元成本;越低越好。
  • 最终得分是一个综合得分,分数越高越好,从而允许对具有不同定价和延迟特征的模型进行直接比较。

为什么 Qwen 3.8 Max 的领先地位值得关注

核心观点: 这一结果标志着中国模型在复杂的智能体工作负载上已经赶上、甚至在某些情况下超越了西方前沿模型。

  • 工具使用熟练度 – Qwen 3.8 Max 在 τ³-Banking(工具使用)和 Terminal-Bench v2.1(编程与终端自动化)方面表现出色。
  • 推理深度 – 在 GPQA Diamond(科学推理)和 CritPt(物理推理)上的强劲表现提升了其整体智能评分。
  • 成本效率 – 尽管是一个 open-weights 模型,其单任务成本与 GPT-5.6 等领先模型相当,这使其对于注重预算的部署极具吸引力。

社区对排名波动性的观察

核心观点: 几位评论者报告了排行榜上得分的快速波动,引发了对数据稳定性的质疑。

"我点击查看时,它显示 Qwen 排在第一,得分为 55.4,而 Opus Max 为 55.3……然后 Qwen 变成了第二,得分为 58.4,Opus Max 为 59.2。图表上方的描述在两种情况下都是一样的。发生了什么?" – d2p

"几天前他们发布了该模型的总分为 53,但后来被删除了,今天它带着 56 的分数回来了。我无法从他们那里找到解释。" – quirino

这些报告表明,底层数据可能会频繁刷新,或者综合得分对基准测试权重、延迟测量或价格更新的微小变化非常敏感。该网站目前并未为 Agentic Index 本身发布变更日志,因此波动的确切原因仍未记录在案。


用户的真实体验

核心观点: 早期采用者注意到其强大的故障排除能力,但也指出了实际应用中的局限性。

  • 正面评价: 用户称赞 Qwen 3.8 Max 构建诊断工具和对日志数据进行统计分析的能力,在复杂的 bug 追踪任务上表现优于 Kimi K3 等模型。 – eli
  • 注意事项: 一些用户发现该模型表现“粗糙”,偶尔会出现输出中断、缺失测试或误解任务的情况。 – SwellJoe
  • 性能担忧: 在消费级 GPU(如 Strix Halo)上的 prefill 延迟报告约为 300-400 ms,这可能会影响交互式使用。 – syntaxing

与其他前沿模型的成本比较

核心观点: 尽管是 open-weights 模型,Qwen 3.8 Max 的单任务成本与 GPT-5.6 等专有模型非常接近。

"为什么一个 open weights 模型成本几乎与 GPT5.6 一样?成本指数上是 $1.14 对 $1.23。鉴于其规模无法在本地运行,按这个速度来看,我看不出有理由离开 GPT。" – drnick1

成本指标综合考虑了输入、cache-hit、cache-write、推理和回答 token 的价格。由于 Qwen 3.8 Max 通过多个供应商提供,定价各不相同,但综合指数反映出其与领先的闭源产品几乎持平。


对 AI 格局的影响

核心观点: Qwen 3.8 Max 的崛起重塑了中国和西方 AI 厂商之间的竞争动态。

  • 基准测试对等 – 中国模型现在在相同的智能体指标上,与 Anthropic 的 Claude Opus 5、OpenAI 的 GPT-5.6 以及 DeepSeek V4 Flash 并驾齐驱。
  • 潜在的市场转移 – 如果定价和可访问性得到改善,开发者可能会考虑将 Qwen 3.8 Max 用于智能体工作负载,特别是当 open-weights 许可符合公司政策时。
  • 未来版本 – 市场对更小、可在本地运行的变体(例如 27B 版本)充满期待,这可能会使在消费级硬件上实现高质量的智能体推理成为可能。 – jjcm, h14h

开放性问题与后续步骤

核心观点: 用户应关注该指数的稳定性,并根据独立评估来验证得分。

  1. 方法论透明度 – Artificial Analysis 可以为 Agentic Index 发布版本化的变更日志,以解释得分变化。
  2. 本地基准测试 – 在个人硬件上运行 open-weights 的 Qwen 3.8 Max(一旦发布更小的变体)将为成本与性能的权衡提供具体的基准。
  3. 跨基准测试验证 – 将 Agentic Index 的结果与其他排行榜(例如 LL-M Benchmark、OpenAI 自身的评估)进行比较,将有助于评估一致性。

总结: Qwen 3.8 Max 在 Artificial Analysis Agentic Index 上的登顶表明,中国前沿模型已经具备了具有竞争力的工具使用和规划能力,但用户在为生产级智能体工作负载选择模型时,应意识到得分的波动性和实际应用中的可靠性差异。

Sources

相关