Netlify Agent Runners: Comparing 11 AI Models for Web Development

High-end models provide superior design but at significantly higher credit costs

Netlifyによる11のAIモデルの評価は、視覚的な出力とリソース消費の両面において、極めて対照的な結果を示しています。Claude Opus 5のようなトップティアのモデルは、カスタムベクターグラフィックスやダークモードをサポートした、非常に詳細で美的に洗練されたサイトを生成しますが、1回の実行につき最大1,055クレジットを消費する場合があり、これは低コストな代替モデルよりも桁違いに高価です。対照的に、DeepSeek V4 Flash 0731などのモデルは、わずか1.3〜3.4クレジットで機能的なサイトを生成できます。

Model Performance Breakdown: Design vs. Cost

Netlifyは、近所のコーヒーショップ向けの1ページサイトを構築するというシンプルなプロンプトを使用して、これらのモデルをテストしました。その結果、「ターンキー(即時利用可能)」な高忠実度デザインと、反復的で低コストな開発との間のトレードオフが浮き彫りになりました。

Frontier Closed-Source Models

  • Claude Opus 5: 視覚的な詳細さと自己検証におけるゴールドスタンダード。最も洗練されたデザインを生成しますが、クレジット使用量に大きなばらつきがあり、自身のベースラインよりも4倍多く消費することもあります。
  • Claude Sonnet 5: 中位のオプションであり、ある程度の詳細さは維持していますが、Opusよりもシンプルなベクターグラフィックスと少ないコンテンツしか生成しません。
  • GPT 5.6 Sol (Low Effort): 基本的なデザインの直感とコンテンツの豊かさにおいてClaude Sonnet 5を上回り、かつ経済的な競争力も維持しています。
  • GPT 5.6 Terra: Solよりもシンプルですが、しばしば「AI生成」特有の美学を回避した独特の視覚言語を提供します。ただし、画像欠落などの視覚的なグリッチが発生することもあります。
  • Gemini 3.6 Flash vs. 3.1 Pro: この2つの間には世代的な飛躍があります。Gemini 3.6 Flashはモダンでコンテンツ豊かな結果を生成しますが、Gemini 3.1 Proは創造的な拡張を一切行わず、プロンプトに厳密に従った最小限のページを生成します。

Open-Weight and Specialized Models

  • DeepSeek V4 Flash (0731): テストされた中で最もコスト効率の高いモデルで、平均2.4クレジットです。驚くほど多様な結果を生成し、実行によっては中位のクローズドモデルを模倣することもあります。
  • GLM 5.2: 低コストなオプション(平均27クレジット)ですが、実行ごとに出力が大きく異なり、最良の結果を見つけるには複数の反復が必要であることを示唆しています。
  • Kimi K3 & K2.7 Code: Kimi K3は長期的なエージェントタスク向けに設計されていますが、短文のデザインタスクで特に際立っているわけではありません。Kimi K2.7 Codeは極めて安価(19クレジット)ですが、デザインやコンテンツの価値は最小限です。
  • DeepSeek V4 Pro: 同価格帯のGPT 5.6 Terraと比較して、インスピレーションに欠ける結果であり、画像リンクの切れ目などの技術的な失敗が時折見られます。

Technical Implementation: Agent Runners and AXIS

Netlifyは、簡略化されたバージョンではなく、完全なコーディングエージェントを統合したAgent Runnersを利用しています。これらのエージェントは、Netlify Database、AI Gateway、Netlify BlobsといったNetlify特有のプリミティブを利用するための特定のスキルとプロジェクトコンテキストを備えています。

品質を維持するために、Netlifyはオープンソースの評価フレームワークであるAXISを使用しています。AXISは、視覚的なデザインではなく、必要な場合にデータベースが正しく実装されているかといった「機能的な正確性」に基づいてモデルをスコアリングします。これらの機能チェックに合格しないモデルや、クレジットコストが膨れ上がるモデルは、Agent Runnersから除外されます。

Community Perspectives and Critical Analysis

Hacker Newsでの開発者間の議論では、これらの「ワンショット」プロンプトはアイデア出しには有用ですが、プロフェッショナルなソフトウェア開発のワークフローを代表するものではない可能性があることが示唆されています。

Key Critiques

  • Prompt Realism: 一部の開発者は、プロフェッショナルな業務は2文のプロンプトではなく、詳細で反復的な指示を伴うものであると主張しています。あるユーザーは次のように述べています:

    "This 'oneshot from a simple prompt' eval is fairly meaningless when it comes to model evaluation itself, as it is in no way representative of real world application."

  • Statistical Significance: 批判的な意見として、サンプルサイズが小さい(N=3)ことが指摘されており、確率的なモデルが信頼できるパフォーマンスのベースラインを確立するには、より多くの実行が必要であると述べられています。
  • Mobile Optimization: 評価における重大な欠落は、モバイルファーストのデザインへの焦点の欠如でした。ユーザーの分析によると、一部の高コストモデルは、デスクトップでは視覚的に印象的でも、モバイルデバイスでは効果的でないか、読み込みが遅いサイトを生成していました。
  • Utility of Simplicity: 一部のユーザーは、より安価なモデル(Gemini 3.1やDeepSeek V4など)の出力を好んでおり、「飾り気のない」テキストベースのサイトの方が、「スタイリッシュな」AIデザインよりも実際の顧客にとって理解しやすいと主張しています。

Summary of Model Credit Usage

Model Avg Credits Notable Characteristic
Claude Opus 5 519 Highest detail, highest cost variance
Claude Sonnet 5 143 Mid-tier balance
GPT 5.6 Sol (Low Effort) 141 Strong design intuition
Gemini 3.6 Flash 103 Modern, content-rich
Kimi K3 102 Optimized for long-horizon tasks
Gemini 3.1 Pro 53 Minimalist, strictly prompt-adherent
GPT 5.6 Terra 39 Distinct, less "AI-feeling" style
DeepSeek V4 Pro 37 Occasional technical glitches
GLM 5.2 27 High variance in output style
Kimi K2.7 Code 19 Extremely low cost, low design value
DeepSeek V4 Flash (0731) 2.4 Maximum efficiency, surprising variety

Sources

関連