X-Cell 4.9B 參數擴散模型實現虛擬細胞中的因果擾動預測
X-Cell 4.9B 參數擴散模型實現虛擬細胞中的因果擾動預測
TL;DR
X-Cell 是一個 4.9 B 參數的擴散模型,使用最大規模的全基因組 CRISPRi Perturb‑seq 數據集(25.6 M 細胞、16 種情境)進行訓練,能遠超線性基線地預測細胞對未見基因擾動的反應,證明高品質的因果數據——而非計算資源——是虛擬細胞模型的限制因素。
1. 為什麼因果數據勝過觀測圖譜
- 觀測圖譜(例如 Cell X‑Gene)捕捉相關性,但無法唯一推斷因果調控網路。正如 Xi Chu 所說,基因 A、B、C 的相同共變可以由多種因果圖解釋,使得純描述性數據在反事實預測上力不從心。
- 因果數據——系統性的基因敲降結合單細胞 RNA‑seq——提供了學習真實因果關係所需的干預訊號。
- X‑Cell 的訓練集 X‑Atlas/Pisces 是一個匯聚的 CRISPR‑Cas9 Perturb‑seq 計畫,能在數百萬細胞中同時擾動每一個基因,消除批次效應,並產生密集的 2‑D 張量(基因 × 擾動 × 細胞)。
"如果只看描述性數據,你可以擬合許多可能的因果結構;這些數據在真正學習因果性方面是力不足的。" – Xi Chu
2. 從自回歸到擴散編輯
- 早期的虛擬細胞模型(scGPT、GeneFormer)使用 自回歸 token 預測,假設基因有任意排序。這種排序對表達矩陣而言是人為的,限制了生成的忠實度。
- X‑Cell 採用 擴散語言模型:從一個嘈雜、模糊的基因表達向量開始,逐步精煉,類似於編輯草稿句子。這消除了預先設定基因順序的需求,且更契合轉錄組學的高維特性。
- 擴散過程持續降低損失,顯示模型學會向真實表達譜編輯。
"與其說是打字,不如說擴散語言模型是編輯:你從一個非常模糊、粗糙的起點迭代生成句子,然後不斷精練。" – Bo Wang
3. 架構與先驗知識整合
- X‑Cell 是一個 僅解碼器的 transformer,擁有 4.9 B 參數,從 scGPT 的編碼器權重初始化。
- 訓練時透過 cross‑attention 注入五種異質生物先驗:
- 文獻嵌入(基因特定的文字描述)
- 蛋白質‑蛋白質互動(PPI)網路
- 癌症必需性圖譜(DevMap)
- 形態學嵌入
- 細胞類型嵌入(acid‑GBT)
- 消融實驗顯示,先驗雖能提升情境特異性準確度,但 主要的效能驅動因素 仍是因果數據的規模與多樣性。
4. 實證結果:超越訓練情境的泛化
4.1 未見的 T 細胞活化
- 模型在靜止調節性 T 細胞上訓練後,被要求預測活化後的反應(它從未見過此情境)。
- 線性基線(簡單的加法 delta)失敗,而 X‑Cell 正確重現已知的 TCR 複合體失活,並發現了新的潛在抑制因子。
4.2 iPSC 分化中的留出細胞類型
- 在多系譜 iPSC 篩選中,將一種分化細胞類型排除於訓練之外。X‑Cell 能準確預測該留出譜系上數千基因的擾動效應。
4.3 原代供體 T 細胞
- X‑Cell 在不朽化的 T 細胞系上訓練後,能泛化至多位供體的原代 T 細胞,儘管生物學上有顯著轉變,仍與真實擾動譜相匹配。
這些實驗共同證明了 跨情境 與 跨物種 的泛化能力,為虛擬細胞的實用性樹立了關鍵里程碑。
5. 規模洞見:數據多樣性勝過算力
- 訓練損失隨模型規模的變化與大型語言模型相似,但當數據多樣性受限時,泛化性能會趨於平緩。
- 作者將貢獻排序為:
- 數據品質與多樣性(全基因組、多情境 Perturb‑seq)
- 模型架構(擴散 vs. 自回歸)
- 生物先驗(情境特異性提升)
- 這與蛋白質設計領域相呼應:豐富的高品質結構數據(PDB)推動了 AlphaFold,而單細胞生物學仍受數據瓶頸限制。
"我們離細胞建模中同等規模、高品質的數據還很遙遠…這是一個數據限制的問題。" – Xi Chu
6. 未來方向
6.1 多模態與空間擴展
- 計畫整合空間轉錄組、ATAC‑seq、蛋白質組與影像資料,以捕捉細胞‑微環境互動。
- 目前版本尚未處理空間座標,但未來版本將加入空間感知嵌入。
6.2 組合擾動
- 雖然模型僅在單基因敲降上訓練,擴散解碼器可在 in silico 中組合擾動 token,推測多基因效應,為探索組合療法提供了不需大規模濕實驗的途徑。
6.3 時間序列(“魔杖”)
- 社群最大的未滿需求是能在 同一細胞上多時間點測量 的技術(目前的 scRNA‑seq 會殺死細胞)。若能實現活細胞的縱向單細胞分析,將極大豐富因果數據,並使真實的動態虛擬細胞建模成為可能。
"你不能兼得蛋糕與吃掉它——目前,要測序一個細胞必須把它殺死。對虛擬細胞而言,真正的‘魔杖’是活細胞的時間序列測序。" – Bo Wang
7. 開放科學與產學協同
- X‑Cell 的程式碼、模型權重與 Pisces 數據集已在 GitHub 公開,呼應 AlphaFold 的開源成功。
- 演講者強調 學術實驗室 擅長開創新型測試(CRISPR、scRNA‑seq),而 產業 能夠規模化與工業化數據生成。兩者的共生關係對領域進步至關重要。
"開放科學加速了虛擬細胞研究,就像開放的蛋白質結構數據加速了 AlphaFold。" – Bo Wang
8. 研究人員的要點
- 優先收集因果、高通量的擾動數據,而非僅僅增大模型參數。
- 擴散編輯 相較於自回歸 token 預測,更自然地契合高維基因表達生成。
- 利用 異質生物先驗 提升情境特異性表現,但將其視為對數據的補充。
- 在 未見細胞類型與原代樣本 上驗證模型,以展示真正的轉譯相關性。
- 參與並使用 開放數據集,共同推動虛擬細胞前沿。
X‑Cell 代表了 AI 驅動、因果預測細胞反應的關鍵一步,強調未來的突破將來自更豐富、多樣的擾動數據,而非單純更大的模型。