Tokenomics: Quantifying Token Consumption in Agentic Software Engineering

The Primary Cost of Agentic SE is Refinement, Not Generation

基於 LLM 的多智能體 (LLM-MA) 系統研究顯示,自動化軟體工程中最顯著的資源支出發生在迭代精煉與驗證階段。根據研究報告 "Tokenomics: Quantifying Where Tokens Are Used in Agentic Software Engineering",代幣消耗量中,代碼審查 (Code Review) 階段平均佔了 59.4%

這一發現將對智能體成本的理解從最初的代碼生成轉向了確保代碼正確且功能完備所需的開銷。這表明,實踐應用智能體軟體工程的主要瓶頸並非模型的生成能力,而是智能體所使用的協作與驗證協議的低效率。

Token Distribution Across the SDLC

為了量化這些成本,研究人員分析了使用 GPT-5 推理模型進行的 ChatDev 框架 30 個軟體開發任務的執行軌跡。該研究將內部智能體階段映射到標準化的軟體開發生命週期 (SDLC) 框架,包括設計 (Design)、編碼 (Coding)、代碼補全 (Code Completion)、代碼審查 (Code Review)、測試 (Testing) 與文檔 (Documentation)。

Key Consumption Metrics

  • Dominant Stage: Code Review 是最昂貴的階段,消耗了近 60% 的所有代幣。
  • Input vs. Output: 輸入代幣 (Input tokens) 持續佔據消耗的最大份額,平均為 53.9%
  • Resource Focus: 數據顯示,智能體軟體工程的成本在自動化精煉與驗證方面佔據很大比重,而非最初的代碼草案。

Inefficiencies in Agentic Collaboration

高比例的輸入代幣 (53.9%) 為智能體如何溝通與處理資訊的低效率提供了實證證據。在多智能體系統中,智能體通常會重新閱讀大量的上下文或整個代碼庫來進行微小的調整。

社群中的從業者也反映了這一點。一位開發者指出,在其自身經驗中,輸入與輸出比率顯著更高:

I'm seeing a ratio of around 10:1 in my usage... The agent will often read a million tokens just to patch one line of code.

這種模式表明,目前的智能體工作流是 "token-heavy" (代幣密集型) 的,即提供上下文的成本遠遠超過了生成實際解決方案的成本。

Economic and Operational Implications

代幣消耗的不確定性為 AI 集成軟體工具的商業可行性帶來了重大障礙。由於代幣使用量在迭代審查週期中可能會激增,企業很難精確地為這些工具進行預算編列。

Market Sustainability and Pricing

社群討論突顯了對代幣定價的隨機性以及 AI 授權缺乏透明度的日益關注。一些用戶報告在定價更新後,代幣可用性發生了劇烈變化,這導致人們懷疑目前的 AI 商業模式對供應商和客戶而言在經濟上可能都是不可持續的。

The Shift Toward Token Optimization

隨著運行這些系統的成本變得更加明顯,工程需求預計將發生轉變。正如早期的基礎設施工程師因其優化硬體與網路效率的能力而受到重視,未來的軟體工程師可能會根據其優化 AI 智能體的 "token efficiency" (代幣效率) 的能力來衡量,以減少運營開銷與環境影響。

Sources