AutoArk/TinyEngram
Research of DeepSeek Engram Architecture based on Qwen-3 and Stable Diffusion series.
What it solves
TinyEngram は、大規模モデルに新しい知識や概念を注入する際に「破滅的忘却」――新しい専門情報を学習することでモデルが汎用能力を失う――を防ぐ課題に取り組みます。また、LoRA のような従来のファインチューニング手法に比べて、パラメータ効率の高い代替手段を提供します。
How it works
本プロジェクトは Engram アーキテクチャを実装し、トランスフォーマーレイヤーにコンパクトな N‑gram メモリモジュールとゲート付きリトリーバル機構を追加します。ベースモデルの重みを直接変更するのではなく、トリガーインデックス方式で特定のメモリを取得・統合します。
このアプローチはテキストとビジョンの両方に拡張されます:
- LLM(Qwen)向け: デコーダ層に専門知識(例: バイオメディカルデータ)を注入。
- Vision(Stable Diffusion)向け: プロンプト中の特定 N‑gram を認識して Text Encoder に視覚概念を注入し、巨大な U‑Net や DiT バックボーンをファインチューニングせずに新しい対象を生成可能にします。
Who it’s for
AI 研究者や開発者で、元のモデルの汎用性能とパラメータ効率を保ちつつ、LLM に専門領域知識や画像生成モデルに新しい視覚概念を統合したい方々向けです。
Highlights
- Resistance to Catastrophic Forgetting: 新領域への適応時に汎用能力を保持し、LoRA を上回る性能を示します。
- Multimodal Capability: Stable Diffusion(SD1.5 と SD3.5)へのメモリ注入に成功し、軽量な概念注入を実現。
- Parameter Efficiency: フルファインチューニング不要で、外科手術のように軽量にモデルに新情報を「教える」ことができます。
- Infinite Composability: ビジョンタスクにおいてメモリ同士が干渉せず、何千もの異なる概念をスタックしてもベースモデルの性能を低下させません。