AutoArk/TinyEngram

Research of DeepSeek Engram Architecture based on Qwen-3 and Stable Diffusion series.

What it solves

TinyEngram 解決了將新知識或概念注入大型模型時,避免「災難性遺忘」的挑戰——模型在學習新、專業資訊時不會失去其通用能力。它同時提供了一種比傳統微調(如 LoRA)更具參數效率的替代方案。

How it works

此專案實作了 Engram 架構,於 transformer 層加入緊湊的 N‑gram 記憶模組與門控檢索機制。它不直接修改基礎模型的權重,而是使用觸發索引系統來檢索並整合特定記憶。

此方法同時擴展至文字與視覺領域:

  • 對於 LLM(Qwen): 在解碼層注入專業知識(例如生醫資料)。
  • 對於視覺(Stable Diffusion): 透過在提示詞中辨識特定 N‑gram,將視覺概念注入文字編碼器,使模型在不微調龐大的 U‑Net 或 DiT 主幹的情況下生成新主題。

Who it’s for

AI 研究者與開發者,想要在保持原始模型通用表現與參數效率的前提下,將專業領域知識注入 LLM,或將新視覺概念注入圖像生成模型。

Highlights

  • Resistance to Catastrophic Forgetting: 在保留通用能力的同時,優於 LoRA 的新領域適應表現。
  • Multimodal Capability: 成功將記憶注入擴展至 Stable Diffusion(SD1.5 與 SD3.5),實現輕量概念注入。
  • Parameter Efficiency: 以外科手術般的輕量方式「教」模型新資訊,無需完整微調。
  • Infinite Composability: 在視覺任務中,記憶彼此不干擾,可堆疊千種不同概念而不削弱基礎模型。