Netlify Agent Runners: 比較 11 款用於網頁開發的 AI 模型

高階模型提供卓越設計,但點數成本顯著較高

Netlify 對 11 款 AI 模型的評估顯示,在視覺輸出與資源消耗方面存在著鮮明的對比。頂尖模型如 Claude Opus 5 能產生高度細節、美感精緻的網站,並具備自定義向量圖形與深色模式支援,但每次執行可能消耗高達 1,055 點數——這比經濟實惠的替代方案高出好幾個數量級。相比之下,DeepSeek V4 Flash 0731 等模型僅需 1.3 到 3.4 點數即可生成具備功能的網站。

模型性能分析:設計 vs. 成本

Netlify 使用簡單的提示詞來測試這些模型,目標是為一家社區咖啡店建立一個單頁面網站。結果突顯了「即開即用」的高保真設計與迭代式、低成本開發之間的權衡。

前沿閉源模型

  • Claude Opus 5: 視覺細節與自我驗證的金標準。它能產生最複雜的設計,但在點數使用上表現出高變異性,偶爾會比其基準值高出 4 倍。
  • Claude Sonnet 5: 中階選項,能維持一定的細節,但產生的向量圖形較簡單,內容也比 Opus 少。
  • GPT 5.6 Sol (Low Effort): 在基礎設計直覺與內容豐富度方面優於 Claude Sonnet 5,同時保持了經濟競爭力。
  • GPT 5.6 Terra: 提供了一種獨特的視覺語言,比 Sol 更簡單,但通常能避免「AI 生成」的既視感,儘管偶爾會遇到視覺錯誤,例如圖片遺失。
  • Gemini 3.6 Flash vs. 3.1 Pro: 這兩者之間存在世代跨度。Gemini 3.6 Flash 能產生現代化且內容豐富的結果,而 Gemini 3.1 Pro 則產生極簡的頁面,嚴格遵循提示詞而沒有任何創意擴展。

開源權重與專業化模型

  • DeepSeek V4 Flash (0731): 測試中最具成本效益的模型,平均消耗 2.4 點數。它能產生令人驚訝的多樣化結果,部分執行結果甚至能模擬中階閉源模型。
  • GLM 5.2: 低成本選項(平均 27 點數),在不同執行次數中產生的輸出非常多樣,這顯示出需要多次迭代才能找到最佳結果。
  • Kimi K3 & K2.7 Code: 雖然 Kimi K3 是為長程代理任務設計的,但在短篇幅設計任務中並不特別出眾。Kimi K2.7 Code 極其便宜(19 點數),但提供的設計或內容價值極低。
  • DeepSeek V4 Pro: 與價格相近的 GPT 5.6 Terra 相比,結果較不具啟發性,且偶爾會出現技術故障,例如圖片連結失效。

技術實作:Agent Runners 與 AXIS

Netlify 利用 Agent Runners,其整合了完整的編碼代理,而非精簡版本。這些代理具備特定技能與專案上下文,能利用 Netlify 特有的原語(primitives),例如 Netlify Database、AI Gateway 與 Netlify Blobs。

為了維持品質,Netlify 使用 AXIS,一個開源的評估框架。AXIS 會根據功能正確性(例如在需要時是否正確實作了資料庫)而非視覺設計來為模型評分。未能通過這些功能檢查或點數成本過高的模型會被排除在 Agent Runners 之外。

社群觀點與批判性分析

Hacker News 上的開發者討論指出,雖然這些「一次性」提示詞對構思很有用,但它們可能無法代表專業的軟體開發工作流程。

關鍵批判

  • 提示詞寫實性: 一些開發者認為,專業工作涉及的是詳細且具備迭代性的指令,而非僅僅兩句話的提示詞。一位用戶指出:

    "This 'oneshot from a simple prompt' eval is fairly meaningless when it comes to model evaluation itself, as it is in no way representative of real world application."

  • 統計學意義: 批評者指出樣本量過小(N=3),並提到機率性模型需要更多次的執行來建立可靠的性能基準。
  • 行動裝置優化: 評估中的一個關鍵缺口是缺乏對行動裝置優先設計的關注。用戶分析顯示,某些高點數消耗模型產生的網站,在桌機端視覺效果令人印象深刻,但在行動裝置上卻無效或載入緩慢。
  • 利用簡約性: 一些用戶更偏好便宜模型(如 Gemini 3.1 或 DeepSeek V4)的輸出,認為對於實際客戶而言,「無裝飾」的純文字型網站比「風格化」的 AI 設計更容易理解。

模型點數使用量摘要

Model Avg Credits Notable Characteristic
Claude Opus 5 519 最高細節,最高成本變異性
Claude Sonnet 5 143 中階平衡
GPT 5.6 Sol (Low Effort) 141 強大的設計直覺
Gemini 3.6 Flash 103 現代化,內容豐富
Kimi K3 102 Long-horizon tasks 優化
Gemini 3.1 Pro 53 極簡主義,嚴格遵循提示詞
GPT 5.6 Terra 39 Distinct, less "AI-feeling" style
DeepSeek V4 Pro 37 Occasional technical glitches
GLM 5.2 27 高輸出風格變異性
Kimi K2.7 Code 19 極低成本,低設計價值
DeepSeek V4 Flash (0731) 2.4 最大效率,驚人的多樣性

Sources

相關