Netlify Agent Runners: 比較 11 款用於網頁開發的 AI 模型
高階模型提供卓越設計,但點數成本顯著較高
Netlify 對 11 款 AI 模型的評估顯示,在視覺輸出與資源消耗方面存在著鮮明的對比。頂尖模型如 Claude Opus 5 能產生高度細節、美感精緻的網站,並具備自定義向量圖形與深色模式支援,但每次執行可能消耗高達 1,055 點數——這比經濟實惠的替代方案高出好幾個數量級。相比之下,DeepSeek V4 Flash 0731 等模型僅需 1.3 到 3.4 點數即可生成具備功能的網站。
模型性能分析:設計 vs. 成本
Netlify 使用簡單的提示詞來測試這些模型,目標是為一家社區咖啡店建立一個單頁面網站。結果突顯了「即開即用」的高保真設計與迭代式、低成本開發之間的權衡。
前沿閉源模型
- Claude Opus 5: 視覺細節與自我驗證的金標準。它能產生最複雜的設計,但在點數使用上表現出高變異性,偶爾會比其基準值高出 4 倍。
- Claude Sonnet 5: 中階選項,能維持一定的細節,但產生的向量圖形較簡單,內容也比 Opus 少。
- GPT 5.6 Sol (Low Effort): 在基礎設計直覺與內容豐富度方面優於 Claude Sonnet 5,同時保持了經濟競爭力。
- GPT 5.6 Terra: 提供了一種獨特的視覺語言,比 Sol 更簡單,但通常能避免「AI 生成」的既視感,儘管偶爾會遇到視覺錯誤,例如圖片遺失。
- Gemini 3.6 Flash vs. 3.1 Pro: 這兩者之間存在世代跨度。Gemini 3.6 Flash 能產生現代化且內容豐富的結果,而 Gemini 3.1 Pro 則產生極簡的頁面,嚴格遵循提示詞而沒有任何創意擴展。
開源權重與專業化模型
- DeepSeek V4 Flash (0731): 測試中最具成本效益的模型,平均消耗 2.4 點數。它能產生令人驚訝的多樣化結果,部分執行結果甚至能模擬中階閉源模型。
- GLM 5.2: 低成本選項(平均 27 點數),在不同執行次數中產生的輸出非常多樣,這顯示出需要多次迭代才能找到最佳結果。
- Kimi K3 & K2.7 Code: 雖然 Kimi K3 是為長程代理任務設計的,但在短篇幅設計任務中並不特別出眾。Kimi K2.7 Code 極其便宜(19 點數),但提供的設計或內容價值極低。
- DeepSeek V4 Pro: 與價格相近的 GPT 5.6 Terra 相比,結果較不具啟發性,且偶爾會出現技術故障,例如圖片連結失效。
技術實作:Agent Runners 與 AXIS
Netlify 利用 Agent Runners,其整合了完整的編碼代理,而非精簡版本。這些代理具備特定技能與專案上下文,能利用 Netlify 特有的原語(primitives),例如 Netlify Database、AI Gateway 與 Netlify Blobs。
為了維持品質,Netlify 使用 AXIS,一個開源的評估框架。AXIS 會根據功能正確性(例如在需要時是否正確實作了資料庫)而非視覺設計來為模型評分。未能通過這些功能檢查或點數成本過高的模型會被排除在 Agent Runners 之外。
社群觀點與批判性分析
Hacker News 上的開發者討論指出,雖然這些「一次性」提示詞對構思很有用,但它們可能無法代表專業的軟體開發工作流程。
關鍵批判
- 提示詞寫實性: 一些開發者認為,專業工作涉及的是詳細且具備迭代性的指令,而非僅僅兩句話的提示詞。一位用戶指出:
"This 'oneshot from a simple prompt' eval is fairly meaningless when it comes to model evaluation itself, as it is in no way representative of real world application."
- 統計學意義: 批評者指出樣本量過小(N=3),並提到機率性模型需要更多次的執行來建立可靠的性能基準。
- 行動裝置優化: 評估中的一個關鍵缺口是缺乏對行動裝置優先設計的關注。用戶分析顯示,某些高點數消耗模型產生的網站,在桌機端視覺效果令人印象深刻,但在行動裝置上卻無效或載入緩慢。
- 利用簡約性: 一些用戶更偏好便宜模型(如 Gemini 3.1 或 DeepSeek V4)的輸出,認為對於實際客戶而言,「無裝飾」的純文字型網站比「風格化」的 AI 設計更容易理解。
模型點數使用量摘要
| Model | Avg Credits | Notable Characteristic |
|---|---|---|
| Claude Opus 5 | 519 | 最高細節,最高成本變異性 |
| Claude Sonnet 5 | 143 | 中階平衡 |
| GPT 5.6 Sol (Low Effort) | 141 | 強大的設計直覺 |
| Gemini 3.6 Flash | 103 | 現代化,內容豐富 |
| Kimi K3 | 102 | Long-horizon tasks 優化 |
| Gemini 3.1 Pro | 53 | 極簡主義,嚴格遵循提示詞 |
| GPT 5.6 Terra | 39 | Distinct, less "AI-feeling" style |
| DeepSeek V4 Pro | 37 | Occasional technical glitches |
| GLM 5.2 | 27 | 高輸出風格變異性 |
| Kimi K2.7 Code | 19 | 極低成本,低設計價值 |
| DeepSeek V4 Flash (0731) | 2.4 | 最大效率,驚人的多樣性 |
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch