Grok 4.5、GPT-5.5 與 Claude 程式碼比拼比較
執行摘要
在一次直接的「比拼」中比較 Grok 4.5、GPT-5.5、Claude Opus 4.8 與 Claude Fable 5,結果顯示可靠性與效率之間的取捨。Claude 系列模型(Opus 4.8 與 Fable 5)在複雜、具狀態的 3D 任務上展現最高可靠性,而 Grok 4.5 則在吞吐量、延遲與成本效益上領先。
程式碼效能:複雜應用程式生成
為測試模型,每個模型都收到三個相同的提示,要求在不使用外部函式庫或網路呼叫的情況下建立自包含的 HTML 檔案。每個模型僅有一次嘗試,僅在應用程式完全無法渲染時允許一次重試。
3D 魔方(複雜狀態與數學)
Claude Opus 4.8 與 Claude Fable 5 並列獲勝,兩者在首次嘗試即產生正確著色、具動畫旋轉與解答功能的 3D 魔方。Grok 4.5 在首次嘗試失敗(畫面空白),但在重試時成功。GPT-5.5 任務失敗,只渲染出單一暗面而非完整魔方。
粒子重力沙盒(視覺與物理)
四個模型皆產生可運作的沙盒,其中 GPT-5.5 在美學品質上領先。GPT-5.5 創建了發光的霓虹吸引子與濃密的彩色軌跡,Grok 4.5 則專注於乾淨的軌道環,而 Fable 5 使用柔和的發光球體。Claude Opus 4.8 提供了強大的物理效果,但視覺打磨較少。
打磚塊遊戲(標準遊戲邏輯)
四個模型皆取得「平手」結果,在首次嘗試即產出具備計分與生命機制的可玩磚塊破壞遊戲,品質堪稱出貨等級。Grok 4.5 與 GPT-5.5 偏向霓虹街機風格。
營運效率:速度與成本
效能以三個固定提示(涵蓋程式碼、推理與摘要)測量,輸出上限為 400 個 token。
| 模型 | 中位延遲 | 第一個 Token | 吞吐量 | 每回覆成本 |
|---|---|---|---|---|
| Grok 4.5 | 2.8s | 0.44s | 110 tok/s | 0.002¢ |
| GPT-5.5 | 2.0s | 1.26s | 53 tok/s | 0.004¢ |
| Claude Opus 4.8 | 2.6s | 1.16s | 47 tok/s | 0.004¢ |
| Claude Fable 5 | 6.3s | 3.47s | 0.009¢ |
Grok 4.5 是最有效率的模型,提供最快的第一個 token 回應(0.44 秒),吞吐量約為競爭對手的兩倍(約 110 tok/s),且每回覆成本最低。Claude Fable 5 是最慢且最昂貴的,代表高階智慧的高成本。
空間想像力:SVG 生成
模型被要求產生一個手繪的 SVG,內容是一匹馬騎在月球上太空人的背上。
- Claude Fable 5 因創意與幽默獲勝,為場景加入對話。
- GPT-5.5 緊隨其後,馬匹表情愉快。
- Grok 4.5 產生了乾淨、易讀的場景,符合簡報要求。
- Claude Opus 4.8 在視覺上成功,但因原始程式碼中有重複屬性而未通過嚴格的 SVG 解析器檢查。
最終結論
- Grok 4.5 是在延遲與成本為主要限制的高容量程式碼生成的最佳選擇。
- Claude Opus 4.8 與 Fable 5 在複雜、具狀態的架構任務中最可靠。
- GPT-5.5 在短答案的速度與高品質視覺風格之間提供了平衡。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch