Anthropic Claude Fable 5: One-Shot Game Development Benchmark

Anthropic 的 Claude Fable 5 已展現出僅透過單一提示詞即可生成完整、可玩遊戲的能力,這標誌著單次(one-shot)AI 程式碼生成的一個重要里程碑。在開發者 Koen van Gilst 進行的一項基準測試中,該模型生成了一個名為 "Shepherd's Dog" 的完整功能遊戲,其為一個單一的 2,319 行 index.html 檔案,且完全沒有外部依賴。

Technical Execution and Resource Cost

"Shepherd's Dog" 的創建需要大量的推理階段與 Token 的財務投入。該模型在輸出最終程式碼之前,經歷了 45 分鐘的推理階段。這次單次生成的成本約為 20 歐元等值的 Token。

雖然其他模型也針對相同的提示詞進行了測試,但 Fable 5 在精緻度與功能性方面表現優於它們:

  • DeepSeek: 能夠快速生成遊戲(有時在網頁聊天中是免費的),但與 Fable 5 相比,其圖形與遊戲玩法較差。
  • Qwen3.6-27B: 生成的版本最初缺乏羊隻,且需要多次錯誤修復才能變得可玩。

Gameplay and Realism

生成的遊戲模擬了放牧羊群的情景,使用者的評價對於羊隻的移動模式給予了高度讚賞。一位專業的放牧愛好者指出,羊隻的移動是 "excellent",不過他們建議可以透過引入羊隻偏好的 "lusher areas"(更茂盛的區域)或增加 "spastic"(痙攣式)的竄逃行為來增加進一步的真實感,以提供更高難度的模式。

Critical Analysis and Community Debate

該專案在開發者社群中引發了關於 AI 生成程式碼的本質以及單次(one-shot)基準測試有效性的重大辯論。

Training Data and Originality

幾位評論家認為,遊戲的機制是常見的,且很可能以相同的形式存在於模型的訓練數據中。評論家指出,現有的遊戲如 "Sheepherds" 以及各種專注於群聚行為(flocking behaviors)的 GitHub 儲存庫,暗示該模型可能是在合成現有的模式,而非從提示詞中 "inventing"(發明)一個遊戲。

One-Shot vs. Iterative Development

資深開發者認為,雖然達成一個 "local maxima"(局部最大值)令人印象深刻,但這並不能取代專業的軟體開發生命週期。

"Once you start maintaining it, improving it and fixing bugs, you'll eventually need to rip it apart and put it back together again while understanding how it all works."

其他貢獻者指出,親手編寫遊戲將允許開發者發現新的機制,並學習在一次性使用 AI 生成整個程式碼庫時會被跳過的更深層程式設計概念。

Model Accessibility

討論中也凸顯了使用者體驗的分歧,部分使用者對 Fable 模型的直覺能力表示懷念,並指出該模型現在對某些使用者來說受到更多限制或被 "blocked"(封鎖)。

Sources