AutoArk/TinyEngram
Research of DeepSeek Engram Architecture based on Qwen-3 and Stable Diffusion series.
What it solves
TinyEngram 解决了将新知识或概念注入大型模型时,避免「灾难性遗忘」的挑战——模型在学习新、专业信息时不会失去其通用能力。它同时提供了一种比传统微调(如 LoRA)更具参数效率的替代方案。
How it works
此项目实现了 Engram 架构,在 transformer 层加入紧凑的 N‑gram 记忆模块与门控检索机制。它不直接修改基础模型的权重,而是使用触发索引系统来检索并整合特定记忆。
此方法同时扩展至文字与视觉领域:
- 对于 LLM(Qwen): 在解码层注入专业知识(例如生物医学数据)。
- 对于视觉(Stable Diffusion): 通过在提示词中识别特定 N‑gram,将视觉概念注入文本编码器,使模型在不微调庞大的 U‑Net 或 DiT 主干的情况下生成新主题。
Who it’s for
AI 研究者和开发者,想要在保持原始模型通用表现与参数效率的前提下,将专业领域知识注入 LLM,或将新视觉概念注入图像生成模型。
Highlights
- Resistance to Catastrophic Forgetting: 在保留通用能力的同时,优于 LoRA 的新领域适应表现。
- Multimodal Capability: 成功将记忆注入扩展至 Stable Diffusion(SD1.5 与 SD3.5),实现轻量概念注入。
- Parameter Efficiency: 以外科手术般的轻量方式“教”模型新信息,无需完整微调。
- Infinite Composability: 在视觉任务中,记忆彼此不干扰,可堆叠千种不同概念而不削弱基础模型。