Grok 4.5、GPT-5.5 与 Claude 编码对决比较
执行摘要
在一次对比 Grok 4.5、GPT-5.5、Claude Opus 4.8 与 Claude Fable 5 的正面对决("build‑off")中,结果显示可靠性与效率之间存在权衡。Claude 系列模型(Opus 4.8 与 Fable 5)在复杂、带状态的 3D 任务中展现出最高的可靠性,而 Grok 4.5 则在吞吐量、延迟和成本效益方面领先。
编码性能:复杂应用生成
为了测试模型,每个模型都收到三个相同的提示,要求构建不依赖外部库或网络调用的自包含 HTML 文件。每个模型仅有一次尝试机会,只有在应用完全无法渲染时才允许一次重试。
3D 魔方(复杂状态与数学)
Claude Opus 4.8 与 Claude Fable 5 并列获胜,两者在首次尝试即生成了颜色正确、带有动画旋转和求解函数的 3D 魔方。Grok 4.5 首次尝试失败(渲染出空白屏幕),但在重试后成功。GPT-5.5 未完成任务,仅渲染出单面暗色而非完整立方体。
粒子重力沙盒(视觉与物理)
四个模型均生成了可运行的沙盒,其中 GPT-5.5 在美学质量上拔得头筹。GPT-5.5 创建了发光的霓虹吸引体和密集的彩色轨迹,而 Grok 4.5 则侧重于简洁的轨道环,Claude Fable 5 使用了柔和的发光球体。Claude Opus 4.8 提供了强大的物理效果,但视觉打磨略显不足。
打砖块游戏(标准游戏逻辑)
四个模型均实现了“势均力敌”,在首次尝试即生成了可商用、可玩性的砖块破坏游戏,具备计分和生命系统。Grok 4.5 与 GPT-5.5 更倾向于霓虹街机风格的美术表现。
运营效率:速度与成本
性能通过三个固定提示(编码、推理、摘要)进行测量,输出上限为 400 个 token。
| 模型 | 中位延迟 | 首个 Token 时间 | 吞吐量 | 每次回复成本 |
|---|---|---|---|---|
| Grok 4.5 | 2.8s | 0.44s | 110 tok/s | 0.002¢ |
| GPT-5.5 | 2.0s | 1.26s | 53 tok/s | 0.004¢ |
| Claude Opus 4.8 | 2.6s | 1.16s | 47 tok/s | 0.004¢ |
| Claude Fable 5 | 6.3s | 3.47s | 0.009¢ |
Grok 4.5 是最具效率的模型,提供最快的首 token 响应时间(0.44 秒),吞吐量约为竞争对手的两倍(约 110 tok/s),且每次回复成本最低。Claude Fable 5 则是最慢且最昂贵的模型,体现了顶级智能的高端成本。
空间想象力:SVG 生成
模型被要求生成一幅手绘的 SVG:一匹骑在宇航员背上的马在月球上奔跑。
- Claude Fable 5 凭借创意与幽默获胜,在场景中加入了对话气泡。
- GPT-5.5 紧随其后,给马匹添加了欢快的表情。
- Grok 4.5 生成了简洁、易读且符合简要要求的场景。
- Claude Opus 4.8 在视觉上表现良好,但因原始代码中出现重复属性而未通过严格的 SVG 解析器检查。
最终结论
- Grok 4.5 是高吞吐量代码生成的最佳选择,尤其在延迟和成本是主要约束时。
- Claude Opus 4.8 与 Fable 5 在复杂、带状态的架构任务中最为可靠。
- GPT-5.5 在短答案的速度和高质量视觉风格之间提供了平衡。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch