Netlify Agent Runners: 比较 11 种用于 Web 开发的 AI 模型
高端模型提供卓越的设计,但信用额度成本显著更高
Netlify 对 11 种 AI 模型的评估揭示了视觉输出和资源消耗之间的鲜明对比。像 Claude Opus 5 这样的顶级模型可以生成高度详细、美学精良的网站,并支持自定义矢量图形和深色模式,但每次运行可能消耗高达 1,055 个信用额度——这比经济实惠的替代方案高出几个数量级。相比之下,像 DeepSeek V4 Flash 0731 这样的模型仅需 1.3 到 3.4 个信用额度即可生成功能完备的网站。
模型性能细分:设计 vs. 成本
Netlify 使用一个简单的提示词来测试这些模型,目标是为一家社区咖啡馆构建一个单页网站。结果突显了“开箱即用”的高保真设计与迭代式、低成本开发之间的权衡。
前沿闭源模型
- Claude Opus 5: 视觉细节和自我验证的金标准。它能生成最复杂的设计,但在信用额度使用上表现出高波动性,偶尔会比其自身的基准值高出 4 倍。
- Claude Sonnet 5: 中端选项,能保持一定的细节,但生成的矢量图形较简单,内容也比 Opus 少。
- GPT 5.6 Sol (Low Effort): 在基础设计直觉和内容丰富度方面优于 Claude Sonnet 5,同时保持了经济竞争力。
- GPT 5.6 Terra: 提供了一种独特的视觉语言,比 Sol 更简单,但通常能避免“AI 生成”的审美感,尽管偶尔会遇到视觉故障,如图片缺失。
- Gemini 3.6 Flash vs. 3.1 Pro: 这两者之间存在代际差异。Gemini 3.6 Flash 生成的结果现代且内容丰富,而 Gemini 3.1 Pro 生成的是严格遵循提示词的极简页面,没有任何创意扩展。
开源权重与专业化模型
- DeepSeek V4 Flash (0731): 测试过的最经济高效的模型,平均消耗 2.4 个信用额度。它能生成令人惊讶的多样化结果,部分运行结果甚至可以媲美中端闭源模型。
- GLM 5.2: 低成本选项(平均 27 个信用额度),在不同运行中产生高度多样化的输出,这表明需要通过多次迭代来找到最佳结果。
- Kimi K3 & K2.7 Code: 虽然 Kimi K3 是为长程代理任务设计的,但它在短篇幅设计任务中并不出众。Kimi K2.7 Code 极其便宜(19 个信用额度),但提供的设计或内容价值极低。
- DeepSeek V4 Pro: 与价格相近的 GPT 5.6 Terra 相比,其结果较少启发性,且偶尔会出现技术故障,如图片链接失效。
技术实现:Agent Runners 与 AXIS
Netlify 利用 Agent Runners,它们集成了完整的编码代理,而非精简版本。这些代理配备了特定技能和项目上下文,以利用 Netlify 特有的原语,例如 Netlify Database, AI Gateway, 和 Netlify Blobs。
为了保持质量,Netlify 使用 AXIS,一个开源评估框架。AXIS 根据功能正确性(例如,在需要时是否正确实现了数据库)而非视觉设计来为模型评分。未能通过这些功能检查或信用额度成本过高的模型会被排除在 Agent Runners 之外。
社区观点与批判性分析
Hacker News 上的开发者讨论表明,虽然这些“一键式”提示词对构思很有用,但它们可能无法代表专业的软件开发工作流。
关键批判点
- 提示词现实主义: 一些开发者认为,专业工作涉及详细的、迭代的指令,而非仅仅是两句提示词。一位用户指出:
"This 'oneshot from a simple prompt' eval is fairly meaningless when it comes to model evaluation itself, as it is in no way representative of real world application."
- 统计学意义: 批评者指出样本量较小(N=3),并指出概率模型需要更多运行次数来建立可靠的性能基准。
- 移动端优化: 评估中的一个关键差距是缺乏对移动优先设计的关注。用户分析显示,一些高信用额度模型生成的网站在桌面端视觉效果惊人,但移动端设备上显示效果不佳或加载缓慢。
- 实用性与简约性: 一些用户更喜欢廉价价位模型(如 Gemini 3.1 或 DeepSeek V4)的输出,认为“无装饰”的纯文本网站比“风格化”的 AI 设计更易于客户理解。
模型信用额度使用情况总结
| Model | Avg Credits | Notable Characteristic |
|---|---|---|
| Claude Opus 5 | 519 | 细节最高,成本波动性最高 |
| Claude Sonnet 5 | 143 | 中端平衡 |
| GPT 5.6 Sol (Low Effort) | 141 | 强大的设计直觉 |
| Gemini 3.6 Flash | 103 | 现代,内容丰富 |
| Kimi K3 | 102 | Optimized for long-horizon tasks |
| Gemini 3.1 Pro | 53 | Minimalist, strictly prompt-adherent |
| GPT 5.6 Terra | 39 | 独特,较少 "AI-feeling" 风格 |
| DeepSeek V4 Pro | 37 | Occasional technical glitches |
| GLM 5.6 | 27 | 高输出风格多样性 |
| Kimi K2.7 Code | 19 | 极低成本,设计价值极低 |
| DeepSeek V4 Flash (0731) | 2.4 | 最大效率,令人惊讶的多样性 |
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch