X-Cell 4.9B 参数扩散模型实现虚拟细胞中的因果扰动预测

X-Cell 4.9B 参数扩散模型实现虚拟细胞中的因果扰动预测

TL;DR

X-Cell 是一个拥有 4.9 B 参数的扩散模型,使用最大规模的全基因组 CRISPRi Perturb‑seq 数据集(2560 万细胞,16 种情境)进行训练,能够远超线性基线地预测细胞对未见基因扰动的响应,证明高质量的因果数据——而非算力——是虚拟细胞模型的瓶颈。


1. 为什么因果数据胜过观察性图谱

  • 观察性图谱(例如 Cell X‑Gene)捕获的是相关性,无法唯一推断因果调控网络。正如 Xi Chu 所解释的,基因 A、B、C 的同变可以由多种因果图解释,使得纯描述性数据在反事实预测上能力不足。
  • 因果数据——系统性的基因敲降配合单细胞 RNA‑seq——提供了学习真实因果关系所需的干预信号。
  • X‑Cell 的训练集 X‑Atlas/Pisces 是一次性在数百万细胞中同时扰动每个基因的 CRISPR‑Cas9 Perturb‑seq 项目,消除了批次效应,生成了一个稠密的 2‑D 张量(基因 × 扰动 × 细胞)。

"如果只看描述性数据,你可以拟合出许多可能的因果结构;这些数据在学习真正的因果性方面能力不足。" – Xi Chu

2. 从自回归到扩散编辑

  • 早期的虚拟细胞模型(scGPT、GeneFormer)使用 自回归 token 预测,假设基因有任意顺序。这种顺序对表达矩阵来说是人为的,限制了生成质量。
  • X‑Cell 采用 扩散语言模型:从噪声、模糊的基因表达向量出发,迭代细化,类似于编辑草稿句子。这样无需预定义基因顺序,更契合转录组的高维特性。
  • 扩散过程持续降低损失,表明模型学会了向真实表达谱编辑的能力。

"与其说是打字,不如说扩散语言模型是编辑:你从一个非常模糊、粗糙的起点迭代生成句子,然后不断完善它。" – Bo Wang

3. 架构与先验知识融合

  • X‑Cell 是一个 仅解码器的 Transformer,拥有 4.9 B 参数,初始化自 scGPT 的编码器权重。
  • 在训练期间通过交叉注意力注入五种异构生物学先验:
    1. 文献嵌入(基因特定的文本描述)
    2. 蛋白质‑蛋白质相互作用(PPI)网络
    3. 癌症必需性图谱(DevMap)
    4. 形态学嵌入
    5. 细胞类型嵌入(acid‑GBT)
  • 消融实验表明,先验能够提升上下文特异性准确性,但 主要性能驱动因素 仍然是因果数据的规模与多样性。

4. 实证结果:超越训练情境的泛化

4.1 未见的 T 细胞激活

  • 在静息调节性 T 细胞上训练的模型被要求预测激活后的响应(它从未见过该情境)。
  • 线性基线(简单的加性 delta)失效,而 X‑Cell 正确复现了已知的 TCR 复合体失活,并发现了新的潜在抑制因子。

4.2 iPSC 分化中的留出细胞类型

  • 在多谱系 iPSC 筛选中,某一分化细胞类型被排除在训练之外。X‑Cell 能够准确预测该留出谱系上数千基因的扰动效应。

4.3 原代供体 T 细胞

  • X‑Cell 在不死化的 T 细胞系上训练后,能够推广到来自多位供体的原代 T 细胞,尽管存在生物学转变,仍能匹配真实的扰动谱。

这些实验共同展示了 跨情境跨物种 的泛化能力,是虚拟细胞实用性的关键里程碑。

5. 扩容洞见:数据多样性胜过算力

  • 训练损失随模型规模的增长呈现与大语言模型相似的趋势,但当数据多样性受限时,泛化性能会出现平台期
  • 作者将贡献排序为:
    1. 数据质量与多样性(全基因组、多情境 Perturb‑seq)
    2. 模型架构(扩散 vs. 自回归)
    3. 生物学先验(上下文特异性提升)
  • 这与蛋白质设计领域相呼应:丰富的高质量结构数据(PDB)推动了 AlphaFold,而单细胞生物学仍受数据瓶颈限制。

"我们离细胞建模中拥有与蛋白质设计同等规模、高质量的数据仍有很大距离……这是一场数据限制的问题。" – Xi Chu

6. 未来方向

6.1 多模态与空间扩展

  • 计划整合空间转录组、ATAC‑seq、蛋白质组和成像数据,以捕获细胞‑微环境相互作用。
  • 当前版本不处理空间坐标,后续版本将加入空间感知嵌入。

6.2 组合扰动

  • 虽然模型在单基因敲降上训练,但扩散解码器可以 在体外 组合扰动 token,推测多基因效应,为在不进行大规模实验的情况下探索组合疗法提供路径。

6.3 时间序列(“魔杖”)

  • 社区最大的未满足需求是能够 对同一细胞进行多时间点测量 的技术(当前 scRNA‑seq 必须杀死细胞)。实现活细胞的纵向单细胞分析将极大丰富因果数据,进而实现真正的动态虚拟细胞建模。

"你不能既要蛋糕又吃掉它——目前测序细胞必须把它杀死。对活细胞进行时间序列测序才是虚拟细胞的真正‘魔杖’。" – Bo Wang

7. 开放科学与产学协同

  • X‑Cell 的代码、模型权重以及 Pisces 数据集已在 GitHub 上公开发布,效仿 AlphaFold 的开源成功模式。
  • 演讲者强调 学术实验室 擅长开创新型测 assay(CRISPR、scRNA‑seq),而 工业界 能够规模化并产业化数据生成。二者的共生关系对领域进步至关重要。

"开放科学加速了虚拟细胞研究,就像开放的蛋白质结构数据加速了 AlphaFold 一样。" – Bo Wang

8. 给研究者的要点

  1. 优先获取因果、高通量的扰动数据,而不是单纯增加模型参数。
  2. 扩散编辑 相比自回归 token 预测更自然地适配高维基因表达生成。
  3. 利用 异构生物学先验 提升特定上下文性能,但应视其为数据的补充。
  4. 未见细胞类型和原代样本 上验证模型,以展示真正的转化价值。
  5. 贡献并使用 开放数据集,共同推动虚拟细胞前沿。

X‑Cell 代表了向 AI 驱动、因果预测细胞响应迈出的关键一步,强调下一波突破将来自更丰富、更多样的扰动数据,而非更大的模型。

Sources