Claude Opus 5.5 性能与智能分析

Claude Opus 5.5 的智能与能力

Claude Opus 5.5 在原始智能方面被定位为领先模型,尤其是在代理型知识工作和专业推理方面。根据 Artificial Analysis 智能指数 v4.3.2,该模型在十个不同的基准测试中进行了评估,包括 AA-Briefcase v1.1、AutomationBench-AA 和 Terminal-Bench 4.0。

关键智能基准

  • 代理型工作流: 模型在代理型知识工作、现实世界工作任务、SaaS 工作流以及编码/终端使用方面进行测试。
  • 知识可靠性: AA-Omniscience 指数衡量模型提供正确答案的能力,同时惩罚幻觉,得分范围为 -100 到 100。
  • 专业推理: 评估包括医学长上下文推理和专业文档推理(全通过)。

成本与效率分析

与前代模型 Opus 5 相比,Claude Opus 5.5 在高努力设置下的成本效率有显著提升。

每任务成本

一位用户指出,在比较高努力配置时,Opus 5.5 的每任务成本约为 Opus 5 的一半。该效率通过加权平均每智能指数任务成本来衡量,该成本考虑了输入、缓存命中、缓存写入、推理和答案的 token 价格。

token 使用与定价

  • 上下文窗口: 该模型支持大上下文窗口,以促进 RAG(检索增强生成)工作流。
  • 定价结构: 定价包括缓存提示(缓存命中)的特定费率,相比常规输入价格提供折扣。

推理设置:中等、高和最大

Claude Opus 5.5 提供不同推理努力设置——中等、高和最大,每种设置都会影响性能和 token 消耗。

性能权衡

  • 中等(默认): 用户报告该设置在紧凑和长时间运行的循环中均表现良好。
  • 高: 一些用户认为这是性能的“最佳点”,指出基准测试在此设置后通常趋于平稳,且在初步测试中表现良好。
  • 最大: “最大”推理设置可能容易出现“过度思考”。一位用户报告称,模型在仍在思考一个简单的 SVG 生成任务时耗尽了 128,000 token 的预算,未能生成响应。

用户反馈与对比洞察

社区讨论突显了对稳定性和价值的混合看法,既有感知到的改进,也有担忧。

相较于 Opus 5 的改进

用户指出,Opus 5.5 的输出风格和冗长度相比 Opus 5 有显著提升,一些人预测 Opus 5 的使用量将迅速下降。

稳定性与指令遵循

一些用户对 Opus 5 表达了挫败感,指出其相比 Opus 4.8 更容易迷失方向或偏离主题。人们希望 Opus 5.5 能解决这些指令遵循问题。

竞争格局

  • 开源权重 vs. 专有模型: 关于专有模型的价值主张存在持续争论。一些人认为基础模型仅略优于开源权重替代品,但成本高得多。
  • 模型对比: 用户将“顶级”模型归类为 GPT-6、Opus 5/Fable 和 Grok,称赞 Claude 在规划和执行方面表现优异,而 GPT-6 和 Codex 在修复 bug 方面被认为更优。

"技术史充满了‘足够好’每天吃掉‘最好’的案例。除非大实验室能迅速提出可行的商业计划,否则人工智能似乎也不会例外。"

"我两次尝试用最大设置生成一个鹈鹕骑自行车的 SVG 都失败了,因为在两种情况下,模型在仍在思考问题时就耗尽了 128,000 token 的预算。"

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch