volotat/mini-AGI

Continual learning model trained from scratch on 8GB VRAM laptop with batch-1 stream of data.

解決する問題

mini-AGIは、トレーニング後に凍結される従来の大規模言語モデル(LLM)の限界を克服するように設計されています。モデルが新しいデータでトレーニングされたときに以前の知識を失う「破壊的忘却」の問題を解決します。また、ハードウェアの障壁にも対処し、ユーザーがコンシューマーグレードのGPU(8 GB VRAM)1つで、必要に応じてディスクからVRAMに重みを移動することで、言語モデルをゼロからトレーニングできるようにします。

仕組み

このプロジェクトは、継続学習を可能にする独自のアーキテクチャを備えたバイトレベル言語モデルを実装しています。

  • ページングシステム: 8 GB VRAMに収めるために、モデルはエキスパート(重みとAdamモーメント)をディスク上のファイルとして保存し、モデルが今後のテキストに必要と予測するものに基づいて、それらをVRAM(ワーキングセット)にページングします。

  • エキスパートを備えたリカレントブロック: 固定のレイヤースタックの代わりに、2つの高密度プレリュードブロックと、最大24回適用されるリカレントブロックを使用します。ブロックを適用するたびに、共有プールから上位8つのエキスパートを選択します。

  • 適応的深さ: 停止ヘッドが文字の処理をいつ停止するかを決定します。単純な文字は計算行が少なく、複雑な文字はより多く必要とします。

  • 継続学習メカニズム: 忘却を防ぐために、モデルはエキスパートと比較して、「トランク」(埋め込み、アテンション、ルーター、停止ヘッド)に大幅に低い学習率を使用します。これにより、更新がルーティングによって選択された特定のエキスパートに限定され、モデルの残りが保持されます。

  • バイトレベル処理: 256バイト値で動作し、トークナイザーを不要にし、あらゆるファイルタイプを読み取ることができます。

対象読者

インサイチュトレーニングと継続学習に興味があり、適度なハードウェア設定(少なくとも8 GB VRAM GPUを備えたPCまたはラップトップ)にアクセスできる開発者とAI研究者。

ハイライト

  • 継続学習: 破壊的忘却なしに単一のデータストリームから学習できます。
  • ディスクベースの重みストレージ: パラメータ数はVRAMではなくディスクスペースによって制限されます。
  • 自己組織化アーキテクチャ: モデルは既存のエキスパートの再結合を通じて新しいエキスパートを成長させ、未使用のエキスパートを剪定します。
  • エンドツーエンドのトレーニング: トレーニングと読み取りは同じプロセスであり、別個のファインチューニング体制はありません。
  • 直接ファイル読み取り: ユーザーはモデルを自分のファイルやディレクトリに向けて、特定の知識を教えることができます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト