Grok 4.5、GPT-5.5 与 Claude 编码对决比较

执行摘要

在一次对比 Grok 4.5、GPT-5.5、Claude Opus 4.8 与 Claude Fable 5 的正面对决("build‑off")中,结果显示可靠性与效率之间存在权衡。Claude 系列模型(Opus 4.8 与 Fable 5)在复杂、带状态的 3D 任务中展现出最高的可靠性,而 Grok 4.5 则在吞吐量、延迟和成本效益方面领先。

编码性能:复杂应用生成

为了测试模型,每个模型都收到三个相同的提示,要求构建不依赖外部库或网络调用的自包含 HTML 文件。每个模型仅有一次尝试机会,只有在应用完全无法渲染时才允许一次重试。

3D 魔方(复杂状态与数学)

Claude Opus 4.8Claude Fable 5 并列获胜,两者在首次尝试即生成了颜色正确、带有动画旋转和求解函数的 3D 魔方。Grok 4.5 首次尝试失败(渲染出空白屏幕),但在重试后成功。GPT-5.5 未完成任务,仅渲染出单面暗色而非完整立方体。

粒子重力沙盒(视觉与物理)

四个模型均生成了可运行的沙盒,其中 GPT-5.5 在美学质量上拔得头筹。GPT-5.5 创建了发光的霓虹吸引体和密集的彩色轨迹,而 Grok 4.5 则侧重于简洁的轨道环,Claude Fable 5 使用了柔和的发光球体。Claude Opus 4.8 提供了强大的物理效果,但视觉打磨略显不足。

打砖块游戏(标准游戏逻辑)

四个模型均实现了“势均力敌”,在首次尝试即生成了可商用、可玩性的砖块破坏游戏,具备计分和生命系统。Grok 4.5GPT-5.5 更倾向于霓虹街机风格的美术表现。

运营效率:速度与成本

性能通过三个固定提示(编码、推理、摘要)进行测量,输出上限为 400 个 token。

模型 中位延迟 首个 Token 时间 吞吐量 每次回复成本
Grok 4.5 2.8s 0.44s 110 tok/s 0.002¢
GPT-5.5 2.0s 1.26s 53 tok/s 0.004¢
Claude Opus 4.8 2.6s 1.16s 47 tok/s 0.004¢
Claude Fable 5 6.3s 3.47s 0.009¢

Grok 4.5 是最具效率的模型,提供最快的首 token 响应时间(0.44 秒),吞吐量约为竞争对手的两倍(约 110 tok/s),且每次回复成本最低。Claude Fable 5 则是最慢且最昂贵的模型,体现了顶级智能的高端成本。

空间想象力:SVG 生成

模型被要求生成一幅手绘的 SVG:一匹骑在宇航员背上的马在月球上奔跑。

  • Claude Fable 5 凭借创意与幽默获胜,在场景中加入了对话气泡。
  • GPT-5.5 紧随其后,给马匹添加了欢快的表情。
  • Grok 4.5 生成了简洁、易读且符合简要要求的场景。
  • Claude Opus 4.8 在视觉上表现良好,但因原始代码中出现重复属性而未通过严格的 SVG 解析器检查。

最终结论

  • Grok 4.5 是高吞吐量代码生成的最佳选择,尤其在延迟和成本是主要约束时。
  • Claude Opus 4.8 与 Fable 5 在复杂、带状态的架构任务中最为可靠。
  • GPT-5.5 在短答案的速度和高质量视觉风格之间提供了平衡。

Sources

相关