分析 GPT-5.5 的真實成本:價格調漲 vs. Token 效率

從一個前沿模型過渡到下一個模型時,通常需要在性能提升與營運成本之間進行權衡。隨著 GPT-5.5 的發布,OpenAI 實施了顯著的價格調漲:輸入 tokens 從 $2.50/M 跳升至 $5.00/M,輸出 tokens 從 $15/M 升至 $30/M——基礎價格直接翻倍。

然而,原始定價並不總是能說明全部情況。為了了解對最終用戶的實際影響,OpenRouter 對「切換群體」(switcher cohort)進行了成本分析——即那些將主要用途從 GPT-5.4 轉移到 GPT-5.5 的用戶。其目標是確定模型冗餘度(verbosity,即回應長度)的變化是否抵消了更高的每 token 成本。

冗餘度悖論:長文本更簡潔,短文本更冗長

關於 GPT-5.5 的一個關鍵說法是該模型較不冗長,理論上應該會降低每次請求的總成本。OpenRouter 的數據揭示了一個微妙的現實:模型的簡潔程度完全取決於 prompt 的大小。

對於超過 10K tokens 的 prompt,GPT-5.5 確實更有效率,產生的 completion tokens 比其前身減少了 19% 到 34%。然而,對於較短的 prompt,情況則恰恰相反。低於 2K tokens 的 prompt 之 completion 長度大致保持不變(+7%),而 2K 到 10K 範圍內的 prompt,其長度實際上大幅增加,平均變長了 52%。

Prompt Size Median Completion (5.4) Median Completion (5.5) Change
< 2K tokens 121 129 +7%
2K – 10K 140 213 +52%
10K – 25K 211 143 -32%
25K – 50K 185 150 -19%
50K – 128K 188 136 -28%
128K+ 215 143 -34%

結底:實際成本增加

在針對 prompt 長度進行標準化並計算每百萬 tokens 的平均成本後,數據顯示「冗餘度抵消」不足以抵消價格調漲。在所有 prompt 大小中,用戶經歷的成本增加範圍從 49% 到 92%。

使用最短 prompt(< 2K tokens)的用戶受影響最重,成本增加了 92%。而對於極大上下文(50K 到 128K tokens)的使用者,由於模型在這些範圍內變得更簡潔,成本增幅最小,僅為 49%。

| Prompt Size | Avg $/M OR Tokens (5.4) | Avg $/M OR Tokens (5.5) | Change | | :--- | :--- | :--- | :--- | :--- | | < 2K tokens | $4.89 | $9.37 | +92% | | 2K – 10K | $2.25 | $3.81 | +69% | | 10K – 25K | $1.42 | $2.15 | +51% | | 25K – 50K | $1.02 | $1.65 | +62% | | 50K – 128K | $0.74 | $1.10 | +49% | | 128K+ | $0.71 | $1.31 | +85% |

社群觀點:價值 vs. 成本

數據提供了定量的側面,但定性的價值——即性能跳躍是否證明了成本的合理性——在開發者與進階用戶之間仍存在爭議。

支持升級的理由

某些用戶認為原始的每 token 成本是一個誤導性的指標。對於 agentic workflows,真正的成功衡量標準是「完成任務的成本」。如果一個更強大的模型需要更少的輪次(iterations)來解決複雜問題,即使單次請求更貴,總成本也可能更低。

"We observed slightly smaller outputs over long horizon agentic coding for GPT 5.5, at a significant improvement in overall response scores... the responses were significantly stronger. The expected cost increases reported by OpenRouter seem reasonably accurate... but in my opinion, highly worth it."

持懷疑態度的理由

其他用戶則將價格調漲視為收益遞減的跡象,將目前 LLM 發布的現狀與「iPhone 週期」進行比較,即增量式的改進伴隨著更高的價格。

"New model releases are now like new iPhones—mostly imperceivable improvements with a higher price tag... Most businesses require cost control and predictability over a cutting edge with limited evidence of profitable output outside of tech."

此外,一些開發者指出,對於低推理能力的任務,舊的 GPT-5.4 仍然更具成本效益,這表明應根據任務的具體複雜度採取分層式的模型選擇方法。

結論

GPT-5.5 代表了 OpenAI 定價策略的重大轉變。雖然模型在長上下文 prompt 的效率提升緩問及緩解了部分財務影響,但並未完全消除它。對於使用中短長度的 prompt 的用戶,運行 GPT-5.5 的成本幾乎是其前身的兩倍。升級的決定完全取決於是否推理與 agentic 能力的質變能抵消其營運開銷。

Sources