Anthropic 機制設計:用於長時間執行應用程式開發

簡要重點

Anthropic 發布了一個三代理機制(規劃者、生成者、評估者),讓 Claude 能夠在數小時的運行中自主產生豐富的前端設計與全棧應用程式,克服了上下文視窗限制與自我評估偏見。


為何 naïve 的長時間執行代理會失敗

  • 上下文焦慮 – 當 Claude 的上下文視窗填滿時,模型會過早結束工作或失去連貫性。簡單的歷史壓縮雖能保留紀錄,但無法重置模型的內部狀態,因此 Claude 仍會表現出焦慮。完整的上下文重置,搭配結構化的交接文件,能讓模型獲得全新的起點,避免過早終止。
  • 自我評估偏見 – 當代理評估自己的輸出時,往往會過度讚揚,特別是在設計等主觀任務上。將生成與評估分離,讓專門的評估者朝向懷疑態度調整,能提供具體的反饋,讓生成者得以迭代改進。

"代理傾向於自信地讚揚自己的工作——即使人類觀察者認為它只是平庸。" – Anthropic 工程團隊文章


將主觀設計品質轉化為可評分的標準

Anthropic 為前端設計定義了四項明確的評分標準:

  1. 設計品質 – 顏色、字型、版面、影像與氛圍的一致性。
  2. 原創性 – 是否包含自訂決策,而非使用現成或通用的 AI 模式。
  3. 工藝 – 技術執行,例如間距、對比度比率與層次結構。
  4. 功能性 – 無關美學的可用性。

權重 強調設計品質與原創性,因為 Claude 在工藝與功能性上已表現良好。評估者透過少量範例校準,使評分與作者偏好一致。

生成者建立 HTML/CSS/JS 頁面,而評估者使用 Playwright 互動於即時頁面、截圖並產出詳細批判。每輪運行中(5–15 次迭代)交替進行生成與評估,由生成者決定是改良當前方向,還是完全轉向。

觀察到的成果

  • 評分在迭代中提升,雖非總是線性。
  • 標準的措辭直接影響視覺風格(例如「博物館級」引導設計朝特定美學發展)。
  • 在一個荷蘭藝術博物館網站的第 10 次迭代中,生成者從傳統首頁轉向基於 3D CSS 的空間體驗,實現顯著的創意突破。

將 GAN 啟發的模式延伸至全棧開發

三代理架構

代理 角色
規劃者 將 1–4 句提示擴展為詳細的產品規格,識別 AI 增強機會,並避免過度指定低階細節。
生成者 以 React-Vite-FastAPI-SQLite/PostgreSQL 結構,逐功能實作(Sprint),維護 git 歷史,並在交接前自我評估。
評估者 使用 Playwright 執行運行中的應用程式,檢查 UI、API 與資料庫行為,並根據標準(設計、功能、深度、程式碼品質)為每個 Sprint 評分。

關鍵機制

  • Sprint 合約 – 每個 Sprint 前,生成者提出交付成果與驗證步驟;評估者審查並批准,確保與高階規格一致。
  • 檔案式交接 – 代理透過讀取/寫入結構化檔案溝通,保留狀態,無需持續對話。
  • 自動上下文壓縮 – 使用 Claude Agent SDK,機制讓 Opus 4.5 處理不斷增長的上下文,無需明確重置,歸功於模型降低的「上下文焦慮」。

比較基準:單一代理 vs. 完整機制

機制 時間 成本
單一 Claude 執行(單一代理) 20 分鐘 $9
完整三代理機制 6 小時 $200
  • 機制產出的是一款功能更豐富的懷舊遊戲製作工具,擁有精緻的 UI、AI 協助的圖示生成與可運作的遊玩模式;而單一執行版本則面臨版面浪費、實體連接錯誤與無法運作的遊戲玩法問題。

在 Opus 4.6 後簡化機制

  • Opus 4.6 改進了長上下文處理、規劃與自我除錯能力,促使移除 Sprint 分解。
  • 規劃者與評估者仍具價值;若無規劃者,生成者會低估專案範圍。
  • 評估者改為單一終端 QA 通過。在 Opus 4.6 單一能力範圍內的任務,評估者貢獻有限;但在邊際案例中,仍能捕捉關鍵錯誤。

更新後的成本分解(DAW 生成)

階段 時間 成本
規劃者 4.7 分鐘 $0.46
建構回合 1 2 小時 7 分鐘 $71.08
QA 回合 1 8.8 分鐘 $3.24
建構回合 2 1 小時 2 分鐘 $36.89
QA 回合 2 6.8 分鐘 $3.09
建構回合 3 10.9 分鐘 $5.88
QA 回合 3 9.6 分鐘 $4.06
總計 3 小時 50 分鐘 $124.70

評估者仍識別出缺失的核心 DAW 互動(例如可拖曳的片段、儀器面板),顯示即使模型更強大,針對性的 QA 仍是高效益的組成部分。


經驗教訓與未來方向

  1. 上下文重置 vs. 壓縮 – 重置模型上下文可消除「上下文焦慮」,但增加協調開銷。當模型(如 Opus 4.5)表現出強烈焦慮時,重置至關重要;新模型可能僅依賴壓縮。
  2. 獨立評估者 – 調整專用評估者保持懷疑態度,比讓生成者自我批判更可行。評估者的反饋迴路驅動迭代改進。
  3. 可評分的主觀標準 – 將設計原則轉化為明確分數,能將模糊的美學判斷轉化為可操作的反饋。
  4. 迭代式機制精簡 – 隨著模型進步,系統性移除不再提供可衡量提升的元件。評估者的效用取決於任務,非二元。
  5. 混合式分解 – 高階規劃加上功能級 Sprint 合約,平衡範圍控制與彈性,防止早期規格錯誤蔓延。

Anthropic 的工作顯示,經過深思熟慮的機制設計能擴展當前 LLM 的實用能力,且隨著模型能力提升,有用的機制組合空間不減反增。


致謝

感謝 Mike Krieger、Michael Agaby、Justin Young、Jeremy Hadfield、David Hershey、Julius Tarng、Xiaoyi Zhang、Barry Zhang、Orowa Sidker、Michael Tingley、Ibrahim Madha、Martina Long、Canyon Robbins、Jake Eaton、Alyssa Leonard 與 Stef Sequeira 的貢獻。


附錄:規劃者輸出範例(RetroForge 遊戲製作工具)

RetroForge - 2D 懷舊遊戲製作工具

概觀
RetroForge 是一個基於網頁的創意工作室,用於設計與建立 2D 懷舊風格的電子遊戲。它結合了經典 8 位元與 16 位元遊戲美學的懷舊魅力,與現代直覺的編輯工具——讓從業餘創作者到獨立開發者都能在不寫傳統程式碼的情況下,實現遊戲構想。

功能
1. 專案儀表板與管理
   * 建立、開啟、複製、刪除專案
   * 帶縮圖與時間戳的視覺卡片
   * 元資料:名稱、描述、解析度、瓦片大小、調色盤
2. 瓦片式地圖編輯器
   * 拖曳瓦片、圖層、捲動視窗
3. 點陣圖角色編輯器
   * 調色盤選擇器、縮放、幀動畫
4. 物件行為系統
   * 用視覺化腳本控制移動、碰撞
5. 可遊玩測試模式
   * 即時預覽、鍵盤控制
6. AI 協助工具
   * 提示驅動的圖示生成、地圖佈局建議

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch