Tokenmaxxing: AI導入指標が目的化する時

Amazonの従業員に関する最近の報告は、奇妙な傾向を浮き彫りにしています。従業員が生産性を向上させるためではなく、単にAIアクティビティの指標を上げるために、社内のAIツールを使用して余計なタスクやエージェントを作成しているというのです。一部で「tokenmaxxing」と呼ばれているこの現象は、企業がツールの提供する「価値」よりも、ツールの導入「測定」を優先したときに何が起こるかを示す教科書的な例です。

この傾向は単一の企業に限ったことではありません。テック業界全体で、「AIを統合せよ」という経営陣の命令と、ソフトウェアが実際にどのように構築・維持されているかという実務的な現実との間で、緊張が高まっています。使用量指標がパフォーマンスやイノベーションの代用指標(プロキシ)となったとき、従業員は仕事の有用性に関わらず、自然とその指標を満たすように行動を変化させます。

グッドハートの法則の顕在化

この問題の核心にあるのは、グッドハートの法則です。「ある尺度が目標になると、それはもはや良い尺度ではなくなる」。Amazonやその他のFAANG関連企業の場合、その尺度はしばしば「使用されたトークン数」や「AIアクティビティレベル」です。

リーダーシップがリーダーボードを作成したり、高いAI使用率が生産性と結びついていると示唆したりすると、意図せずして無駄を助長してしまいます。あるコメント投稿者が指摘したように、これは、従業員が停滞しているように見えないためだけに、価値のないタスクでトークンを消費することに圧力を感じるという、シュールな環境を生み出します。

"I've done similar at my job where management wants us to use all of our tokens before they expire. I usually set it to documentation tasks and other minor tasks just to eat up tokens."

これは、「投機的労働」のサイクルへとつながります。そこでは、AIが、単に「ダッシュボードを緑色に保つ」ためだけに、誰も使うつもりがないコードやドキュメントの連鎖を生成するために使用されます。

「強制機能」という議論

すべての視点がこの傾向を純粋に破壊的であると考えているわけではありません。一部では、これらの命令が、消極的な従業員を実験へと向かわせる「強制機能(forcing function)」として機能すると主張されています。その論理は、人々にツールを「遊ばせる」ことを強制することで、たとえ最初のユースケースが無意味であっても、最終的には真の生産性向上に突き当たるだろうというものです。

"A good way to learn a piece of software or tool or process is to play with it... Mandates are kind of dumb in many ways. But they will force the issue of discovering whether anything useful can come from AI other than coding."

しかし、この議論はプロフェッショナルなエンジニアリングの現実と衝突します。シニアデベロッパーに、単一のCLIコマンドで済むタスクをLLMを使用して実行させることは「実験」ではありません。それは開発サイクルに摩擦を生じさせる非効率性です。

人為的なアクティビティの隠れたコスト

人間の生産性の損失を超えて、「tokenmaxxing」は重大な外部コストをもたらします。

1. 環境への影響

LLMは計算コストが高いものです。 「価値のないもの」に数百万のトークンを消費することは、不必要なエネルギー消費と炭素排出に寄与します。批判的な人々は、これをソ連時代のクジラの肉の割当制度に例えています。そこでは、割当量を満たすために、肉が実際に必要か、あるいは消費されるかに関わらず、クジラを殺していました。

2. インフラへの負荷

大量の人為的なトラフィックは、AIサービス自体のパフォーマンスを低下させる可能性があります。社内の「トークン消費」が、プロバイダー(Anthropicなど)が正当なユーザーのトラフィックを処理する能力を弱めているのではないかという懸念があります。特に、その企業がプロバイダーの投資家である場合、その懸念は顕著です。

3. 文化的な浸食

従業員がシステムをハックすること(game the system)を奨励されると、メリットクラシー(実力主義)とデリバリーの文化が浸食されます。実際に価値を提供している人々と、24時間体制でトークンを消費するスクリプトを実行してリーダーボードで「快適に1位に君臨している」人々の間に、分断が生じます。

結論: 「Day 2」メンタリティの危険性

絶え間ないイノベーションと顧客への執着を掲げる「Day 1」哲学で有名なAmazonのような企業にとって、社内の指標をハックすることへのシフトは、「Day 2」への移行、つまり停滞とプロセス主導の衰退の状態を感じさせます。

目標が「顧客の課題を解決する」ことから「AI使用量指標を増やす」ことに変わったとき、その企業はイノベーションを停止し、パフォーマンス(演技)を始めたことになります。技術的なリーダーシップへの教訓は明確です。結果をインセンティブ化(動機付け)すべきであり、活動(アクティビティ)をインセンティブ化すべきではありません。もしAIが本当に10倍の生産性向上をもたらすのであれば、その向上はダッシュボード上の高いトークン数ではなく、より速い出荷サイクルとより優れた製品として現れるはずです。

Sources