Codex vs. Claude Code:生產單體視角

在生產系統中探索 AI 程式碼助理的領域可能是一項複雜的任務,尤其是面對已建立且錯綜複雜的程式碼庫時。本篇文章詳細說明一位開發者長達一年之旅以及最近一個月對 OpenAI 的 Codex 與 Anthropic 的 Claude Code(特別是 Opus 4.6 與 4.7)的比較,對象是一個真實世界的多層次 Python 後端單體。所分享的見解並非來自受控的基準測試,而是日常運營使用的體驗,提供了在遺留程式碼與特定業務邏輯限制下,這些工具的實際表現觀點。

生產單體的挑戰

此程式碼庫是一個已有數年歷史的 Python 後端,呈現出多種架構風格的混合。它包含較新、實驗性的領域驅動設計(DDD)類層次、較舊但結構良好的遺留元件,以及一些非常老舊、脆弱的 spaghetti 程式碼。對於此單體的運營策略是除非絕對必要,否則避免重寫,傾向保留舊有部分,直至自然替換或移除。這並非簡單的 CRUD 應用程式;它是一個擁有眾多 A/B 測試與高度特定業務邏輯的複雜系統,對任何 AI 助手而言都是具挑戰性的環境。

為何 Codex 在後端開發中表現卓越

針對此生產 Python 單體的特定需求,Codex 持續展現出卓越的效能,且與開發者的工作流程高度契合。

符合 Harness Engineering 原則

Codex 受青睞的主要原因之一是它能更好地遵循 OpenAI 所闡述的 harness‑engineering 原則。此方法強調構建穩健且可測試的系統。相較之下,Claude 常常需要在 AGENTS.md 檔案中給予非常明確、簡短的指示(例如「Read exec_plan.md and follow it」)才能可靠地遵循類似的工作流程。

優先使用現有工具

在經過多年開發的程式碼庫中,重用現有的專案特定工具與模式對於一致性與可維護性至關重要。Codex 在嘗試創建新工具之前,更擅於在程式碼庫中搜尋現有工具。相對地,Claude 常常產生新工具,導致不必要的重複與偏離已建立的模式。

更佳的情境理解與規劃能力

Codex 在處理複雜任務時展現出更有效的規劃模式。它更常識別出提示缺乏足夠上下文,並在提出架構變更前主動詢問澄清問題。此主動式方法減少了大量來回修正的需求,這也是 Claude 的一大痛點。

Claude 在複雜後端環境中的限制

雖然功能強大,Claude 在應用於生產單體的複雜細節時仍面臨多項挑戰。

傾向重新發明輪子

如前所述,Claude 傾向於創建新工具而非發掘並利用現有工具,這是一個反覆出現的問題。此行為可能在成熟的程式碼庫中引入不一致性與技術債,因為已建立的模式至關重要。

情境掌握不足

Claude 常在建議新功能放置位置前,只閱讀了過少的程式碼或文件。這常導致錯誤的架構決策,例如在 controller 中提出新功能,而非放在適當的模組,或誤解 API 回應。

迭代修正的成本

修正 Claude 的輸出往往需要多輪具體指示。例如:「將此功能放入模組 A,而不是 controller,才是正確的位置。」或「不要使用請求中傳送的狀態來建構回應物件。API 已經回傳更新後的物件——使用該回應,將其納入結果,並驗證其狀態是否符合我們的預期。」這種迭代修正過程令人疲憊且低效,凸顯 Claude 在複雜後端任務的初始規劃與情境整合上的缺口。

不同的領域:前端開發

雖然 Codex 在後端工作上佔有優勢,但在前端開發時情況則相反。

Claude 在 UI 任務上的優勢

開發者發現 Claude Opus 4.6 在前端工作上明顯優於 Codex 5.3 與 GPT-5.4。對於 UI 任務,Claude 是首選工具。此觀點也得到其他開發者的呼應:

"Codex is terrible at frontend. I gave it an existing repo and asked it to take the ui styling and patterns from there, but it still created that classic vibe coded look (even though I had defined everything in the other repo). Claude does it perfectly. (Claude/design is obviously superior to claude code & codex)"

這暗示 Claude,尤其是其設計導向的變體,對 UI 樣式與模式有更深入的理解,使其在產生視覺一致且現代的前端程式碼時更為有效。

對新模型的崛起觀點

有評論者提到對新模型的不同體驗:

"I switched from Claude to Codex + GPT-5.5 (with image2) recently and UI-first development just feels really different."

雖然原作者尚未測試 GPT-5.5 在大量 UI 工作上的表現,但此評論暗示 Codex/GPT 的新迭代,特別是具備多模態功能如 image2 的版本,可能正在改變前端開發的格局,為 UI‑first 工作流程提供新的可能性。

Sources