GPT-5.6、Grok 4.5 与 Claude Fable 5 编码对决分析
前沿模型在复杂编码任务中保持领先
前沿模型在复杂、新颖的编码任务上仍显著优于开源权重的替代方案,尽管在常见模式上差距有所缩小。在一次涉及12个模型的大规模对决中——包括全新的 GPT-5.6 系列(Sol、Terra、Luna)、Claude Fable 5 和 Meta 的 Muse Spark 1.1——GPT-5.6 Sol 和 Claude Fable 5 成为高复杂度应用的最佳表现者。
任务特定性能细分
3D 射线投射迷宫
GPT-5.6 Sol 提供了最一致且最详细的结果。
在 Doom 风格的射线投射任务中,GPT-5.6 Sol 和 GPT-5.6 Luna 均实现了 5/5 的可玩性成功率。GPT-5.6 Sol 被认为在整体细节和一致性方面表现最佳。Grok 4.5 证明是一种可行且具成本效益的替代方案,同样取得了 5/5 的成功率;而 Muse Spark 1.1 展示出很高的潜力,但缺乏一致性,仅在 2/5 次尝试中成功。
3D 魔方
Claude Fable 5 在魔方任务中以完美的成功率占据主导。
Claude Fable 5 在“干净解答”(平滑动画且无故障或颜色变化)方面取得了 5/5 的成功率。相比之下,Claude Opus 4.8 未能产生一次完美解答(0/5)。GPT-5.6 Sol 和 Terra 表现良好(4/5),但 GPT-5.6 Luna 完全失败(0/5),在打乱后常立即崩溃。
功能计算器
Claude 系列模型在标准实用工具构建中表现出最高可靠性。
Claude Opus 4.8 与 Claude Fable 5 均取得了 5/5 的成功率。虽然 GPT-5.6 Sol 也达到了 5/5,但因过度美化(尝试 3D 渲染)而受到批评,这有时会降低用户体验,相比之下更简洁、更加一致的 GPT 系列模型和 Grok 4.5 的输出更为清晰。
康威的生命游戏
开源权重模型在成熟的编码模式上具有竞争力。
与 3D 任务不同,生命游戏足够简单,使得 Qwen 3.7 Plus 和 GLM-5.2 等开源权重模型能够以远低于前沿模型的成本表现出色。这表明,对于拥有丰富训练数据和现有开源示例的任务,成本与性能的比率显著倾向于 OSS 模型。
速度、成本与效率
性能在 GPT-5.6 各层级和开源权重模型之间差异显著:
- 延迟(Latency): GPT-5.6 Luna 在短提示上最快,响应时间约为 1.0 秒。Qwen 3.7 Plus 也因“极其低廉且快速”而受到关注。
- 吞吐量(Throughput): Qwen 3.7 Plus 在每秒令牌数上领先(204 tok/s),而 DeepSeek V4 Pro 和 GLM-5.2 则最慢。
- 成本(Cost): 开源权重模型(Qwen、GLM、DeepSeek)始终提供最低的每次请求成本。
SVG 渲染与组合
Claude Fable 5 在一次性 SVG 生成中超越所有其他模型,尤其是在需要构图和相似度的任务(例如科技亿万富翁的漫画肖像)中表现突出。GPT-5.6 系列模型在此类任务中被描述为“平淡”,生成的结果更卡通化且细节不足。
社区洞察与批评
技术用户的讨论突出了关于方法论和结果的若干关键点:
- 知识 vs. 推理: 一些批评者认为视觉基准可能衡量模型检索训练数据(知识)的能力,而非在潜在空间中对几何和动画进行推理的能力。
- Benchmaxxing(基准最大化): 某些模型(如 GLM-5.2)在新颖任务上失败,尽管基准分数很高,这表明出现了“benchmaxxing”趋势,即模型被优化针对特定测试集而非通用能力。
- 真实世界应用: 有用户指出,一次性随机应用的测试并不能反映专业软件工程的工作流程,后者通常涉及迭代开发。
“前沿模型仍在艰难任务上获胜,在复杂任务上也并不特别接近……在像生命游戏这样简单、成熟的任务上,OSS 模型也能保持竞争力。”
摘要表:模型亮点
| 模型 | 主要优势 | 显著弱点 |
|---|---|---|
| GPT-5.6 Sol | 复杂的 3D/射线投射 | 在简单任务上过度美化 |
| Claude Fable 5 | 3D 逻辑(立方体)与 SVG 艺术 | 成本/延迟更高 |
| Grok 4.5 | 性价比 | 细节不如 Sol |
| Qwen 3.7 Plus | 速度与成本 | 在新颖/复杂工作上表现不足 |
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch