volotat/mini-AGI

Continual learning model trained from scratch on 8GB VRAM laptop with batch-1 stream of data.

它解决了什么

mini-AGI 旨在克服传统大型语言模型(LLM)在训练后被冻结的限制。它解决了“灾难性遗忘”的问题,即模型在训练新数据时会失去先前的知识。它也解决了硬件障碍,允许用户在单个消费级 GPU(8 GB VRAM)上从零开始训练语言模型,方法是按需将权重从磁盘移至 VRAM。

它的运作方式

此项目实现了一个字节级语言模型,具有独特的架构,允许持续学习:

  • 分页系统: 为了适应 8 GB VRAM,模型将专家(权重和 Adam 动量)存储为磁盘上的文件,并根据模型对即将到来的文本所需的预测,将它们分页到 VRAM(工作集)中。

  • 带专家的循环块: 它不是固定的层堆叠,而是使用两个密集前奏块和一个最多应用 24 次的循环块。每次应用该块时,会从共享池中选取前 8 个专家。

  • 自适应深度: 一个停止头决定字符何时停止处理;简单的字符需要较少的计算行,而复杂的字符则需要更多。

  • 持续学习机制: 为了防止遗忘,模型对“主干”(嵌入、注意力、路由器和停止头)使用显著较低的學習率,与专家相比。这将更新限制在路由选择的特定专家,从而保留模型的其余部分。

  • 字节级处理: 它操作 256 个字节值,无需分词器,并允许它读取任何文件类型。

适合谁

对原位训练和持续学习感兴趣的开发人员和 AI 研究人员,他们拥有适度的硬件设置(配备至少 8 GB VRAM GPU 的 PC 或笔记本电脑)。

亮点

  • 持续学习: 能够从单一数据流中学习,而不会发生灾难性遗忘。
  • 基于磁盘的权重存储: 参数数量受磁盘空间限制,而非 VRAM。
  • 自组装架构: 模型通过重组现有专家来产生新专家,并修剪未使用的专家。
  • 端到端训练: 训练和阅读是同一过程,没有单独的微调机制。
  • 直接文件阅读: 用户可以将模型指向自己的文件或目录,以教导它特定知识。

相关

  • 项目
  • 项目
  • 项目
  • 项目