トークンのコストが非常に安すぎる – AIコンピューティングコストが急落している理由
トークンコストは過去のどのトレンドよりも急速に低下している
過去12か月間、AIタスクの完了コストは約 2.5 次元低下しました。これは、ハードウェア効率、モデルアーキテクチャ、インファレンスエンジンの同時進歩によって駆動されています。これにより、トークンのコストは非常に低くなり、外部ツール(例:grep、HTMLパース、cargo buildなど)を呼び出すオーバーヘッドが、ワークフロー全体のコストの大部分を占めるようになるでしょう。
ハードウェア効率の向上
GPUの効率は2年ごとに2倍に
GPUのエネルギー効率(GFLOP/J)の対数プロットは 1.3-ログの傾き を示しており、効率は約2年ごとに2倍になるという意味です。これは、モアの法則の歴史的なペースと同等です。このトレンドは、初期の消費者向けGPUから最新のデータセンター用H100に至るまで、世代を問わず成立しています。
"これは1960年代のモアの法則以来、我々が見たことのない効率の向上です。" – 投稿者
インファレンスエンジンは年率10〜50%向上
vLLM などのオープンソースエンジンは、バージョン0.5.4(2024年9月)から0.11.1(2025年12月)の間に、1トークンあたりのジュール数を約40%削減しました。NVIDIAのフルスタックMLPerfスタックは、バージョン2.0から2.1で最大 50%の効率向上 を報告しており、IntelのMLPerf 6.1は6.0と比較して 2.4倍のスループット向上 を示しています。
モデルレベルのコスト削減
タスク単位コストは低下するが、トークン単価は横ばい
フロントランモデルは依然として類似したトークン単価を維持していますが、より大きなモデルははるかに少ないトークンでタスクを完了できます。2025〜2026年の品質対コストのパレートフロンティアは、同じベンチマークを1年前と比べて 100倍安価に実行可能 であることを示しています。
ミクスチャー・オブ・エキスパート(MoE)がコンピューティングを削減
MoEアーキテクチャは、不要なエキスパート層を無効化することで、同等のベンチマーク性能に対して最大 7倍少ないパラメータ で実現できます。ローカルデプロイではメモリ上にすべてのエキスパートが必要ですが、全体としての 1ジュールあたりの品質 は劇的に向上します。
専用モデルがトレンドを加速
JevとLayaは「無料」の出力トークンを実現
TypeSafeの Jev クラスファイアは、入力トークンに対して $0.042 / MTok、出力トークンに対して $0 を課金します。これは 10億トークンあたり約$42 であり、5冊の本を読むコストに相当します。オープンウェイトの Laya はファインチューニング後、Jevと同等またはそれ以上の精度を達成しますが、セットアップがより複雑です。
"これは補助金があるとは証明できません。長期的に価格の持続可能性を証明する必要があります(我々は価格が上昇するのではなく、下がると予想しています)。" – TypeSafeの価格に関する注記
トークンがツールコールより安くなるとき
GPT-5.6 Luna($0.30 / Mトークン)と一般的なMacBook Air(アイドル時10W、高負荷時30W)を用いたざっくりとした計算によると、以下の通りです:
| ツール | 効率 (W) | 時間 (s) | コスト (¢) | Lunaのターンより何次元安いか |
|---|---|---|---|---|
grep |
10 | 0.1 | 0.000007 | 4.5 |
| HTMLパース | 10 | 1 | 0.00007 | 3.5 |
cargo build |
30 | 30 | 0.00625 | 1.5 |
現在のレートでは、LLM呼び出しのコストが単純な grep よりも安くなる ことが予想され、従来のツールパイプラインにモデルを埋め込むことが経済的に魅力的になります。
経済的逆効果
サプライサイドのジェヴォンズの逆説
高い効率は 誘発需要 を生み出します:AIプロバイダーは、1ドルあたりの収益が高くなるため、より多くのコンピューティングリソースに投資します。これは、安価な電力が全体的な消費を増加させた古典的なジェヴォンズの逆説に似ています。
ビジネスモデルの持続可能性
批判者は、安価なトークンだけでは利益を保証しないと指摘しています。プロバイダーは依然として フロントランモデルのプレミアム価格、エンタープライズ契約、ボリュームベースのサービスに依存しています。オープンウェイト競争はマージンを圧迫する可能性がありますが、ハードウェアベンダー(例:NVIDIA)や専用インファレンスサービスは、スケールの利点から引き続き利益を得続けるでしょう。
未来のシナリオ
- 普遍的なローカルインファレンス – 3〜6年以内に、RAM効率の高いアーキテクチャ(Mamba、4ビット量子化)とMoEスケーリングのおかげで、フロントラン品質のモデルがコンシューマーハードウェアで実行可能になると予想されています。
- AI強化ツール – トークンコストがツールコールコストを下回ると、開発者は一時的なスクリプトをモデル駆動のアシスタント(例:
jgrep)に置き換えるようになります。ビルドスケジューラー、セキュリティスキャナー、CIパイプラインはAIファーストになる可能性があります。 - ソフトウェア価値のシフト – 主な差別化要因は、単なる機能性から 品質、セキュリティ、統合性 に移行するでしょう。スイッチングコストが高い従来のSaaS製品は優位性を維持する一方、柔軟性がありAI生成されたソフトウェアはニッチ分野に広がるでしょう。
コミュニティの反応
"トークンがツールコールより安くなる… これはスティーンの法則を呼び出す好機だと思います:『何かが永遠に続くことはできないなら、それは止まるだろう。』" – @jetrink
"パレートチャートは価値判断なしには意味を持たない。『最も魅力的な四分位』は読者を誤解させる。" – @meatmanek
"エネルギー効率のグラフは多くのトレンドラインにフィットすることができる。GPUの2年ごとの2倍という主張には、より厳密な統計的裏付けが必要だ。" – @empw
"インファレンスが商品化し続けるなら、ハードウェアマージンは縮小し、利益はサービスや専用チップにシフトするだろう。" – @bryanlarsen
これらのコメントは、永続的な指数関数的トレンドに対する懐疑、ベンチマーク可視化の注意深い解釈の必要性、そして長期的なビジネス持続可能性への懸念を示しています。
まとめ
ハードウェア効率、モデルアーキテクチャの進歩、ソフトウェアエンジンの最適化 の融合により、AIトークンコストは1年間で 2次元以上低下 しました。これにより、トークンのコストは多くの従来のコンピューティングプリミティブよりも安くなり、AIがソフトウェアツールやインフラの基盤に直接埋め込まれる未来が見えてきました。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch