Tokenomics: Agentic Software Engineeringにおけるトークン消費量の定量化

Agentic SEの主なコストは生成ではなく、洗練(Refinement)である

LLMベースのマルチエージェント(LLM-MA)システムに関する研究により、自動ソフトウェアエンジニアリングにおける最も重要なリソース消費は、反復的な洗練および検証フェーズで発生することが明らかになりました。研究「Tokenomics: Quantifying Where Tokens Are Used in Agentic Software Engineering」によると、コードレビュー段階が総トークン消費量の平均59.4%を占めています

この知見は、エージェントのコストに関する理解を、コードの初期作成から、コードが正確で機能することを確認するために必要なオーバーヘッドへとシフトさせます。これは、エージェントによるソフトウェアエンジニアリングの実用的な導入における主なボトルネックが、モデルの生成能力ではなく、エージェントが使用するコラボレーションおよび検証プロトコルの非効率性にあることを示唆しています。

SDLC全体におけるトークン分布

これらのコストを定量化するために、研究者たちは、GPT-5 reasoning modelを使用したChatDev frameworkによる30のソフトウェア開発タスクの実行トレースを分析しました。この研究では、内部エージェントフェーズを、Design、Coding、Code Completion、Code Review、Testing、Documentationからなる標準的なソフトウェア開発ライフサイクル(SDLC)フレームワークにマッピングしました。

主要な消費メトリクス

  • 支配的な段階: Code Reviewは最もコストのかかるフェーズであり、全トークンのほぼ60%を消費します。
  • 入力 vs 出力: 入力トークンは一貫して消費の最大のシェアを占め、平均**53.9%**に達します。
  • リソースの焦点: データは、エージェントによるソフトウェアエンジニアリングのコストが、コードの初期ドラフト作成よりも、自動化された洗練および検証に大きく偏っていることを示しています。

エージェント間のコラボレーションにおける非効率性

入力トークンの高い割合(53.9%)は、エージェントがどのように通信し情報を処理するかにおける非効率性の実証的な証拠を提供しています。マルチエージェントシステムにおいて、エージェントはしばしば、軽微な調整を行うために、大規模なコンテキストやコードベース全体を再読取します。

この観察結果は、コミュニティの実務家によっても裏付けられています。ある開発者は、自身の経験において入力対出力の比率が著しく高いことを指摘しました:

I'm seeing a ratio of around 10:1 in my usage... The agent will often read a million tokens just to patch one line of code.

このパターンは、現在のエージェントのワークフローが「トークン過多(token-heavy)」であることを示唆しています。つまり、コンテキストを提供するためのコストが、実際の解決策を生成するためのコストをはるかに上回っています。

経済的および運用上の影響

トークン消費量の予測不可能性は、AI統合型ソフトウェアツールの商業的生存能力に大きな障害をもたらします。反復的なレビューサイクル中にトークン使用量が急増するため、企業はこれらのツールの予算を正確に立てることが困難になります。

市場の持続可能性と価格設定

コミュニティの議論では、トークン価格設定の恣意的な性質や、AIライセンスにおける透明性の欠如に関する懸念が高まっています。一部のユーザーは、価格改定後にトークンの可用性が劇的に変化したことを報告しており、現在のAIビジネスモデルがプロバイダーと顧客の両方の双方にとって経済的に持続不可能である可能性への疑念が生じています。

トークン最適化へのシフト

これらのシステムを運用するコストがより明白になるにつれ、エンジニアリング要件に変化が予測されます。初期のインフラエンジニアがハードウェアやネットワークの効率を最適化する能力で評価されたように、将来のソフトウェアエンジニアは、運用オーバーヘッドと環境への影響を軽減するために、AIエージェントの「トークン効率」を最適化する能力によって判断されるようになるかもしれません。

Sources