AutoArk/TinyEngram

Research of DeepSeek Engram Architecture based on Qwen-3 and Stable Diffusion series.

What it solves

TinyEngram 解决了将新知识或概念注入大型模型时,避免「灾难性遗忘」的挑战——模型在学习新、专业信息时不会失去其通用能力。它同时提供了一种比传统微调(如 LoRA)更具参数效率的替代方案。

How it works

此项目实现了 Engram 架构,在 transformer 层加入紧凑的 N‑gram 记忆模块与门控检索机制。它不直接修改基础模型的权重,而是使用触发索引系统来检索并整合特定记忆。

此方法同时扩展至文字与视觉领域:

  • 对于 LLM(Qwen): 在解码层注入专业知识(例如生物医学数据)。
  • 对于视觉(Stable Diffusion): 通过在提示词中识别特定 N‑gram,将视觉概念注入文本编码器,使模型在不微调庞大的 U‑Net 或 DiT 主干的情况下生成新主题。

Who it’s for

AI 研究者和开发者,想要在保持原始模型通用表现与参数效率的前提下,将专业领域知识注入 LLM,或将新视觉概念注入图像生成模型。

Highlights

  • Resistance to Catastrophic Forgetting: 在保留通用能力的同时,优于 LoRA 的新领域适应表现。
  • Multimodal Capability: 成功将记忆注入扩展至 Stable Diffusion(SD1.5 与 SD3.5),实现轻量概念注入。
  • Parameter Efficiency: 以外科手术般的轻量方式“教”模型新信息,无需完整微调。
  • Infinite Composability: 在视觉任务中,记忆彼此不干扰,可堆叠千种不同概念而不削弱基础模型。