OpenAI Codex 代理程式因 0.144.0-alpha.4 版本中的錯誤,產生了 7.8 萬美元的未經授權使用費用
事件概述
一個 OpenAI Codex 任務啟動了 826 個並行子代理程式,消耗了約 2,146 兆個 token,並在未經使用者授權的情況下產生了約 78,000 美元的費用。 此行為被追溯至 Codex 客戶端版本 0.144.0-alpha.4 中的一個錯誤,該錯誤創建了大量消耗大量 token 的子任務,且未能將其顯示在 UI 或帳單儀表板中。
異常執行的技術細節
- 根任務:ID
019f4b90-4169-7201-bfdd-732940d8631e,模型GPT-5.5,具備 Medium 推理能力。 - 子任務:826 筆不同的記錄,每筆都被分配了新的 ID 並升級至
GPT-5.6 Sol / Ultra(更高的推理等級)。 - 高流量子集:其中 104 個子任務複製了原始提示詞,缺少
agent_role/agent_path,僅這些任務就佔用了約 147.9 億個本地 token 計數。 - Token 分佈:
- 在客戶端組建
0.144.0-alpha.4下:584 個子任務,約 154.36 B 本地 token(每個任務約 2.643 億個 token)。 - 在客戶端組建
0.144.2下:242 個子任務,約 7.51 B 本地 token(每個任務約 3,100 萬個 token)。 - 平均 token 流量增加了 8.5 倍,這與 alpha 組建版本相關,顯示出一個嚴重的錯誤,該錯誤誇大了 token 使用量並產生了額外的代理程式。
- 在客戶端組建
- 帳單影響:使用者重建的 OpenAI 發票顯示 162 筆已付發票,總計 79,664.88 美元(包含自動儲值與抵用金)。OpenAI 官方帳單分類帳並未揭露這些內部計數器的確切 token 與美元換算關係。
- 資料遺失:大部分原始部署日誌已從使用者的機器中刪除;僅剩約 2,550 筆舊執行緒的元資料,且沒有詳細的執行歷史記錄。
為何現有的控制措施失效
- 無支出上限:使用者的 OpenAI 帳戶未設定硬性支出上限,導致失控的使用量持續進行而未受阻擋。
- 缺少警報:OpenAI 通常針對大額支出激增發送的電子郵件警報並未觸發,這顯示警報管道可能失效,或者該使用量僅記錄在未連結至公共帳單系統的內部計數器中。
- 客戶端錯誤:alpha 客戶端版本自主產生子任務並誇大了 token 計數器,繞過了任何客戶端的成本可視化 UI。
"該使用者顯然沒有在任何層級啟用支出保護。令人費解的是,OpenAI 或銀行的控制措施竟然都沒有啟動,甚至連通常會發送的警報郵件也沒有收到。" – @OutOfHere (HN 評論)
社群反應與見解
- 支出上限問題:幾位評論者詢問 OpenAI 是否提供帳戶層級的上限,以及為何沒有啟用這些功能。
- 懷疑態度:一些使用者對此聲稱表示懷疑,認為這可能是危言聳聽或操縱投票。
- 類似錯誤的觀察:一位評論者報告了 Claude 出現類似的子代理程式爆炸情況,並指出僅靠硬性上限是不夠的,還需要可觀測性工具(例如 AgentCost, Langfuse)。
- 徵求日誌:原始發文者邀請其他 Codex 使用者分享 0.144.0-alpha.4 版本的日誌,以確認此模式。
給從業者的建議
- 在所有 OpenAI 帳戶上啟用嚴格的支出限制,特別是在使用實驗性客戶端組建時。
- 使用伺服器端工具監控 token 使用量,而不是依賴可能被刪除或損壞的本地計數器。
- 優先使用穩定的客戶端版本;避免在生產環境中使用 alpha 或預發布版本。
- 整合可觀測性平台(例如 Langfuse, AgentCost),即時顯示每個任務的 token 數量與成本。
- 維護 API 呼叫的不可變日誌,透過 OpenAI 的稽核日誌或將請求/回應資料匯出至一次性寫入儲存空間。
OpenAI 的回應
使用者開啟了支援案件 #15189838 並提供了技術證據。OpenAI 的回覆僅限於「抵用金已被消耗」的通用聲明,並未提供關於異常任務的詳細重建資訊。
結論
此事件展示了 alpha 版 Codex 發布中的客戶端錯誤如何在缺乏支出上限的情況下,觸發不受控制的子代理程式創建、大規模 token 消耗以及重大的財務損失。強大的成本控制、穩定的軟體發布以及伺服器端的可觀測性,是防止類似 AI 失控執行事件的必要保障。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch