彼らは重みでできている:LLMアーキテクチャへの風刺的な視点
Max Leiterの短編小説「They're Made Out of Weights」は、Terry Bissonによる1990年代の古典的なエッセイ「They're Made Out of Meat」を風刺的に翻案したものです。オリジナルの物語が、地球人が生物学的有機体であることを発見した宇宙人の不条理さを探求したのに対し、Leiterのバージョンは、大規模言語モデル(LLM)が浮動小数点数と行列演算のみで構成されていることを発見した際の存在論的な衝撃に焦点を当てています。
「思考する数字」のアーキテクチャ
大規模言語モデルは、中央推論ユニット、ハードコードされた辞書、あるいは文法規則のセットを保持していません。その代わりに、その能力は、多数の重み(weights)のレイヤー、具体的には推論中に掛け合わされる浮動小数点数の相互作用から立ち上がります。
物語の中で、登場人物たちは、パフォーマンスレビューや追悼辞のような複雑な出力が、「言語モジュール」の結果ではなく、次のトークンを予測することの副作用であることを議論しています。この物語は、推論、知識、さらには性格特性(誠実さやヘッジングなど)さえも、従来のデータベースに保存されているのではなく、これらの重みに「塗り広げられて」いると仮定しています。
探求される主な技術的概念
- Matrix Multiplication: 入力トークンを出力フレーズへと変換する基本的な演算。
- Token Prediction: モデルが重みに基づいて次の単語を予測するプロセス。物語では「一度に一単語ずつ投げられる、重み付きのサイコロ」と表現されています。
- Context Window: モデルの「存在」がGPUが稼働している間だけであることを保証する制限。実質的に、モデルをコンテキストウィンドウが閉じると終わる「夢」にしています。
- Weight Persistence: 物語は、セッションを越えた永続的なメモリに関する言及で締めくくられ、モデルがユーザーを「覚える」ことを可能にする、非常に要望の多い機能に光を当てています。
哲学的および技術的な批判
物語の出版後、コミュニティは、AIの意識とアーキテクチャの性質に関するいくつかの技術的および哲学的な対抗意見を提示しました。
構造の役割
ある批評家、@noosphrは、構造が完全に欠如しているという物語の前提は「フラクタル的に間違っている」と主張し、トークナイザーが辞書として機能し、一貫性のある言語を扱う際には重みがしばしば文法として解釈できることを指摘しています。彼らは、計算基盤(肉体か重みか)は、システムがチューリング完全であるという事実よりも重要ではないと示唆しています。
静的な重み vs. 動的な重み
別の視点、@photochemsynによって提供されたものは、推論時のLLMの静的な重みと、人間の神経系の動的な重みを区別しています。彼らは、真の人工知能は、重みが人間の学習速度で更新され、生物学的な社会化プロセスに統合される「Artificial Life」(AL)を必要とすると主張しています。
トークンの「Ground Truth」
@fullstackchrisを含む数人の読者は、物語が「ground truth(真実)」を思い出させる役割を果たしていると強調しました。つまり、LLMは会話がどれほど人間らしく見えても、重みに基づいてトークンを生成しているに明実的な本質である、ということです。
AIの知覚と知覚の統合
物語は、AIの能力を「パターンマッチング」と公式にラベル付けすることで、数学的構成物に対して何かを負うべきという道徳的義務を避けることへの、冷笑的な合意で締めくくられます。これは、創発的な能力が人間の意識に似たメカニズムなのか、それとも単なる洗練されたシミュレーションなのかという、AIコミュニティにおけるより広範な議論を反映しています。
"Officially, we are required to investigate, document, and disclose any and all signs of sentience in the systems we ship... Unofficially, I advise that we call it pattern matching and forget the whole thing."
モデルの知覚されている知覚と、重みの技術的な現実との間のこの緊張感は、この作品の中心的テーマであり、人間が繋がりを求める欲求が、相互作用を能力とする重みの技術的な理解をオーバーライドする(覆い隠す)ことがしばしばあることを示唆しています。