mini-AGI: 消費者向けハードウェア用継続学習バイトレベルモデル

mini-AGIは、8GBのVRAMを持つ単一のコンシューマーGPU上で、完全に新しい状態から訓練可能なバイトレベル言語モデルです。従来の固定モデルとは異なり、mini-AGIは継続学習システムを実装しており、オンライン学習で通常発生する「悲劇的忘却」を回避しながら、データストリームから学習できるようにしています。

アーキテクチャ:ページ化Mixture-of-Expertsと適応的深度

mini-AGIは、メモリ効率と動的計算を最優先する非伝統的なTransformerアーキテクチャを使用しています。固定のレイヤーのスタックではなく、2つの密結合プリロードブロックの後に、最大24回まで繰り返し適用される再帰ブロックを採用しています。

動的計算とルーティング

  • 適応的深度(PonderNet): モデルは、各文字に対してどれだけの計算を費やすかを決定するハーティングヘッドを使用しています。簡単な文字は1行の計算で済む一方、複雑な文字は最大24回の計算を必要とします。これにより、入力の難易度に応じて計算リソースが適切に割り当てられます。
  • 再帰的MoEルーティング: 再帰ブロックが適用されるたびに、共有プールから上位8つのエキスパートを選択します。ルーティングが文字単位ではなくブロック適用単位で行われるため、1つの文字が異なる深度で広範なエキスパートを活用できます。
  • バイトレベル処理: モデルは256のバイト値を直接処理します。トークナイザーを排除することで、新しい語彙を必要とせずにあらゆるデータ型を読み取ることができます。

ページングによるメモリ管理

利用可能なVRAMよりも大きなモデルを収容するために、mini-AGIはページングシステムを実装し、ディスクスペースを重みの主要な保存先として扱います:

  • ディスクストレージ: すべてのエキスパートの重みとAdamオプティマイザーのモーメントは、ディスク上の個別ファイルとして保存されます。
  • VRAMワーキングセット: 任意の時点で、エキスパートの小さなサブセット(ワーキングセット)のみがVRAMに常駐します。
  • 需要に基づくスワッピング: モデルは、前のチャンクのルーティングパターンに基づいて、次のテキストチャンクでどのエキスパートが必要になるかを予測します。エキスパートはディスク、RAMキャッシュ、VRAMの間でスワップされ、前方伝搬に必要なパラメータが常に利用可能になるようにします。

悲劇的忘却の軽減

単一のストリームからの継続学習は、「悲劇的忘却」を引き起こしやすいです。これは新しい情報が古い知識を上書きしてしまう現象です。mini-AGIは以下の2つの主要なメカニズムでこれを解決しています。

本体学習率の分離

モデルの「本体」(埋め込み、アテンション、ルーター、ハーティングヘッドを含む)は、エキスパートよりも著しく低い学習率(0.1x)で訓練されます。

実験データによると、本体とエキスパートで同じ学習率を使用すると、大きな損失(忘却)が発生しますが、0.1xの本体学習率では、ランダムな場合と比較して99.84%の進捗を維持できます。これにより、特定のデータストリームのコンテンツによって、ルーティングや構造的論理が上書きされるのを防ぎます。

構造的隔離

モデルがMixture-of-Experts(MoE)アプローチを使用しているため、任意のパスで更新されるのはモデルの一部にすぎません。524,000文字のチェスデータに対するプローブでは、136のエキスパートのうち54のみが勾配を受け取りました。この構造的隔離により、新しいトピックを学習しても、他のトピックに使用されるパラメータが必ずしも干渉されないことが保証されます。

モデルの成長と削減

mini-AGIは、遭遇するデータに応じて、容量を動的に拡大・縮小するように設計されています:

  • 再結合による成長: モデルの容量が不足している場合、既存のエキスパートの隠れユニットを再結合して新しいエキスパートを作成します。これにより、新しいエキスパートはランダムなノイズではなく、有用な訓練済みコンポーネントから始まります。
  • 使用量による削減: ルーターによって長期間選択されないエキスパートは「死んだ」と見なされ、ディスクから削除されてスペースを回収します。
  • 成長制約: 新しいエキスパートは、特定の条件を満たした場合にのみ追加されます。これには、利用可能なディスク/VRAM容量と、ホールドアウト損失の安定性(「誠実なブレーキ」)が含まれます。

性能とスケーリング

報告時点では、モデルは約3.181億文字を読み込み、169のエキスパートで構成されていました。8つのトピックにおけるホールドアウト損失は0.8336 nats/文字(1.2026 bits/バイト)でした。

データスケーリングの傾向

スケーリング分析によると、モデルは健全なべき乗則(L ∝ D^-0.239)に従っています。著者は、0.80 BPB(バイトあたりビット)に達するには約19.2億バイトのデータが必要であり、これは単一のラップトップGPUで数週間のトレーニングで達成可能だと示唆しています。

コミュニティの洞察と批判

技術ユーザー間の議論は、現在の実装の可能性と限界の両方を浮き彫りにしています:

  • 一般化 vs. メモリ化: 一部のユーザーは、モデルが本当に一般化しているのか、それとも高効率なメモリ化を行っているのか疑問を呈しました。あるユーザーは、モデルの現在のバイトあたりビット(BPB)性能が、enwik9のような特定のデータセットで訓練された非常に小さな密結合モデルよりも高い(悪い)と指摘しました。
  • アーキテクチャの可能性: 継続学習の性質から、「プロトAGI」として機能する可能性があることに対して関心が寄せられており、ネストされた強化学習や自己相似的な再帰的アーキテクチャの探索が提案されています。
  • 学習率に関する懸念: 指摘された点として、本体学習率の低減は悲劇的忘却を遅らせるだけで、完全に排除するものではないとされ、非常に長い時間スケールで本体も最終的に忘却を経験する可能性があるとされています。

"エキスパートプールが忘却を防いでいるわけではありません。ワーキングセットを固定する……コストはわずか0.3571 nats……重みの大部分を保持しても十分ではありません。"

技術仕様要約

コンポーネント 詳細
語彙 265(256バイト + 9マーカー)
コンテキストウィンドウ 4,096
コアアーキテクチャ RMSNorm, RoPE, SwiGLU, Flash Attention
深度 2つのプリロードブロック + 1つの再帰ブロック(最大24回適用)
VRAM要件 最低8 GB
パラメータ管理 ページ化MoE(ディスク $
ightarrow$ RAM $
ightarrow$ VRAM)

Sources

関連