Grok 4.5、GPT-5.5 與 Claude 程式碼比拼比較

執行摘要

在一次直接的「比拼」中比較 Grok 4.5、GPT-5.5、Claude Opus 4.8 與 Claude Fable 5,結果顯示可靠性與效率之間的取捨。Claude 系列模型(Opus 4.8 與 Fable 5)在複雜、具狀態的 3D 任務上展現最高可靠性,而 Grok 4.5 則在吞吐量、延遲與成本效益上領先。

程式碼效能:複雜應用程式生成

為測試模型,每個模型都收到三個相同的提示,要求在不使用外部函式庫或網路呼叫的情況下建立自包含的 HTML 檔案。每個模型僅有一次嘗試,僅在應用程式完全無法渲染時允許一次重試。

3D 魔方(複雜狀態與數學)

Claude Opus 4.8 與 Claude Fable 5 並列獲勝,兩者在首次嘗試即產生正確著色、具動畫旋轉與解答功能的 3D 魔方。Grok 4.5 在首次嘗試失敗(畫面空白),但在重試時成功。GPT-5.5 任務失敗,只渲染出單一暗面而非完整魔方。

粒子重力沙盒(視覺與物理)

四個模型皆產生可運作的沙盒,其中 GPT-5.5 在美學品質上領先。GPT-5.5 創建了發光的霓虹吸引子與濃密的彩色軌跡,Grok 4.5 則專注於乾淨的軌道環,而 Fable 5 使用柔和的發光球體。Claude Opus 4.8 提供了強大的物理效果,但視覺打磨較少。

打磚塊遊戲(標準遊戲邏輯)

四個模型皆取得「平手」結果,在首次嘗試即產出具備計分與生命機制的可玩磚塊破壞遊戲,品質堪稱出貨等級。Grok 4.5 與 GPT-5.5 偏向霓虹街機風格。

營運效率:速度與成本

效能以三個固定提示(涵蓋程式碼、推理與摘要)測量,輸出上限為 400 個 token。

模型 中位延遲 第一個 Token 吞吐量 每回覆成本
Grok 4.5 2.8s 0.44s 110 tok/s 0.002¢
GPT-5.5 2.0s 1.26s 53 tok/s 0.004¢
Claude Opus 4.8 2.6s 1.16s 47 tok/s 0.004¢
Claude Fable 5 6.3s 3.47s 0.009¢

Grok 4.5 是最有效率的模型,提供最快的第一個 token 回應(0.44 秒),吞吐量約為競爭對手的兩倍(約 110 tok/s),且每回覆成本最低。Claude Fable 5 是最慢且最昂貴的,代表高階智慧的高成本。

空間想像力:SVG 生成

模型被要求產生一個手繪的 SVG,內容是一匹馬騎在月球上太空人的背上。

  • Claude Fable 5 因創意與幽默獲勝,為場景加入對話。
  • GPT-5.5 緊隨其後,馬匹表情愉快。
  • Grok 4.5 產生了乾淨、易讀的場景,符合簡報要求。
  • Claude Opus 4.8 在視覺上成功,但因原始程式碼中有重複屬性而未通過嚴格的 SVG 解析器檢查。

最終結論

  • Grok 4.5 是在延遲與成本為主要限制的高容量程式碼生成的最佳選擇。
  • Claude Opus 4.8Fable 5 在複雜、具狀態的架構任務中最可靠。
  • GPT-5.5 在短答案的速度與高品質視覺風格之間提供了平衡。

Sources

相關