volotat/mini-AGI

Continual learning model trained from scratch on 8GB VRAM laptop with batch-1 stream of data.

它解決了什麼

mini-AGI 旨在克服傳統大型語言模型(LLM)在訓練後被凍結的限制。它解決了「災難性遺忘」的問題,即模型在訓練新資料時會失去先前的知識。它也解決了硬體障礙,允許使用者在單一消費級 GPU(8 GB VRAM)上從零開始訓練語言模型,方法是按需將權重從磁碟移至 VRAM。

它的運作方式

此專案實作了一個位元組級語言模型,具有獨特的架構,允許持續學習:

  • 分頁系統: 為了適應 8 GB VRAM,模型將專家(權重和 Adam 動量)儲存為磁碟上的檔案,並根據模型對即將到來的文字所需的預測,將它們分頁到 VRAM(工作集)中。

  • 帶專家的循環區塊: 它不是固定的層堆疊,而是使用兩個密集前奏區塊和一個最多應用 24 次的循環區塊。每次應用該區塊時,會從共享池中選取前 8 個專家。

  • 自適應深度: 一個停止頭決定字元何時停止處理;簡單的字元需要較少的計算列,而複雜的字元則需要更多。

  • 持續學習機制: 為了防止遺忘,模型對「主幹」(嵌入、注意力、路由器和停止頭)使用顯著較低的學習率,與專家相比。這將更新限制在路由選擇的特定專家,從而保留模型的其餘部分。

  • 位元組級處理: 它操作 256 個位元組值,無需分詞器,並允許它讀取任何檔案類型。

適合誰

對原位訓練和持續學習感興趣的開發人員和 AI 研究人員,他們擁有適度的硬體設定(配備至少 8 GB VRAM GPU 的 PC 或筆記型電腦)。

亮點

  • 持續學習: 能夠從單一資料流中學習,而不會發生災難性遺忘。
  • 基於磁碟的權重儲存: 參數數量受磁碟空間限制,而非 VRAM。
  • 自組裝架構: 模型透過重組現有專家來產生新專家,並修剪未使用的專家。
  • 端到端訓練: 訓練和閱讀是同一過程,沒有單獨的微調機制。
  • 直接檔案閱讀: 使用者可以將模型指向自己的檔案或目錄,以教導它特定知識。

相關

  • 專案
  • 專案
  • 專案
  • 專案