Arc 虚拟细胞挑战指南

Arc 虚拟细胞挑战是一项竞赛,旨在开发能够预测在部分未见细胞类型中使用 CRISPR 沉默特定基因效果的模型,这一任务被称为上下文泛化。最终目标是创建一个“虚拟细胞”,能够模拟细胞对参数变化的响应,可能通过减少对昂贵且易出错的实体实验的依赖,加速药物发现。

训练数据与建模约束

本挑战使用了约 30 万条单细胞 RNA 测序概况的精心策划数据集。训练集包含 22 万个细胞,每个细胞由转录组表示——一个稀疏行向量,包含对应基因的 RNA 分子原始计数。在此集合中,大约有 3.8 万个细胞未受扰动(对照细胞),它们作为比较的基本基线。

转录组学中的观察者效应

预测细胞变化的难点在于读取转录组会破坏细胞本身。由于无法在同一细胞的扰动前后进行测量,研究者必须使用一群基础(未受扰动)细胞作为参考。这会引入生物异质性和技术噪声,需要将其与扰动的真实信号分离。受扰动细胞的观测基因表达被建模为扰动真实效应、基线群体的生物异质性以及实验特定技术噪声之和。

STATE 基线模型

Arc 提供了一个名为 STATE 的基线方案,使用了两个基于 Transformer 的模型:State Embedding Model (SE) 和 State Transition Model (ST).

State Transition Model (ST)

State Transition Model 充当细胞模拟器。它使用 Llama 主干,并接受两个输入:一组针对协变量匹配的基础细胞的转录组(或 SE 嵌入)以及表示基因扰动的 one‑hot 向量。这些输入通过独立的 4 层 MLP 编码器,使用 GELU 激活函数。如果模型输出完整的转录组,输出会经过一个学习的解码器。ST 使用最大均值差异(Maximum Mean Discrepancy)进行训练,以最小化预测结果与实际结果的概率分布差异。

State Embedding Model (SE)

State Embedding Model 是一种类似 BERT 的自编码器,旨在创建语义细胞嵌入,以提升跨细胞类型的泛化能力。该过程包括以下几个步骤:

  1. 基因嵌入:模型获取某基因所有蛋白质同工型的氨基酸序列,并通过 ESM2(一个 15B 参数的蛋白质语言模型)处理。随后对其进行均值池化,生成转录本嵌入,再次均值池化得到基因嵌入。
  2. 投影:使用带有 LayerNorm 和 SiLU 激活的学习编码器,将基因嵌入投射到模型维度。
  3. 细胞句子:每个细胞由其按对数折叠表达水平排名前 2048 个基因表示。这些基因嵌入被构建成一个“细胞句子”,其中包含 [CLS] 标记(用作最终细胞嵌入)和 [DS] 标记(用于解耦数据集特定效应)。
  4. 表达调制:为了纳入基因表达的大小,使用“软分箱”算法和两个 MLP 生成表达编码,并将其添加到每个基因嵌入中,类似于位置嵌入。

SE 通过对每个细胞遮蔽 1,280 个基因,并让模型预测这些基因来进行训练。

评估指标

提交作品基于以下三项主要指标进行评估:

扰动判别(PDisc)

该指标评估模型识别扰动之间相对差异的能力。它计算预测转录组与真实值之间的曼哈顿距离,并将其与预测转录组与测试集中所有其他扰动转录组之间的距离进行比较。结果归一化到 0 表示完美匹配的尺度,最终得分按 PDiscNorm = 1 - 2 * PDisc 进行归一化。

差异表达(DE)

差异表达衡量模型正确识别为显著受影响的真实受影响基因的比例。过程包括:

  • 对预测分布和真实分布使用带平局校正的 Wilcoxon 秩和检验计算 p 值。
  • 采用 Benjamini‑Hochberg 方法调节 p 值,降低假阳性率。
  • 计算预测差异表达基因与真实集合的交集,并以真实差异表达基因的数量进行归一化。

平均绝对误差

该指标提供了模型预测平均误差的直接度量。

Sources