Arc 虛擬細胞挑戰簡介

Arc 虛擬細胞挑戰是一項競賽,旨在開發能夠預測在部分未見過的細胞類型中使用 CRISPR 靜默特定基因之效應的模型,此任務稱為情境泛化。最終目標是建立一個「虛擬細胞」,能模擬細胞對參數變化的回應,藉此減少對昂貴且易出錯的實驗的依賴,促進藥物發現的速度。

訓練資料與模型限制

本挑戰使用約 30 萬筆單細胞 RNA 定序資料的精選資料集。訓練集包含 22 萬個細胞,每個細胞以轉錄組表示——一個稀疏的行向量,包含對應基因的 RNA 分子原始計數。在此集合中,大約有 3.8 萬個細胞未受擾動(對照細胞),作為比較的基本基線。

轉錄組學中的觀測者效應

預測細胞變化的難點在於讀取轉錄組會破壞細胞本身。由於無法在同一細胞於擾動前後同時取得測量,研究人員必須以一群基礎(未受擾動)細胞作為參考。這會帶入生物異質性與技術噪聲,必須將其與擾動的真實訊號分離。受擾動細胞的觀測基因表達被建模為擾動真實效應、基線族群的生物異質性以及實驗特定技術噪聲之總和。

STATE 基線模型

Arc 提供了一個名為 STATE 的基線解決方案,使用兩個基於 transformer 的模型:State Embedding Model(SE)與 State Transition Model(ST)。

State Transition Model(ST)

State Transition Model 作為細胞模擬器。它使用 Llama 骨幹,接受兩個輸入:一組針對協變量匹配的基礎細胞的轉錄組(或 SE 嵌入)以及代表基因擾動的 one‑hot 向量。這些輸入會通過獨立的 4 層 MLP 編碼器,使用 GELU 激活函數。若模型產生完整的轉錄組,輸出會經過一個學習的解碼器。ST 以 Maximum Mean Discrepancy 進行訓練,以最小化預測結果與實際結果之機率分佈差異。

State Embedding Model(SE)

State Embedding Model 是類 BERT 的自編碼器,旨在產生語意細胞嵌入,以提升跨細胞類型的泛化能力。此過程包含以下幾個步驟:

  1. Gene Embeddings:模型取得該基因所有蛋白質異構體的胺基酸序列,並透過 ESM2(15B 參數的蛋白質語言模型)處理。這些序列先做平均池化產生轉錄本嵌入,再進行一次平均池化得到基因嵌入。
  2. Projection:使用帶有 LayerNorm 與 SiLU 激活的學習編碼器,將基因嵌入投射至模型維度。
  3. Cell Sentences:每個細胞以其依照對數摺疊表達水平排名前 2048 個基因來表示。這些基因嵌入被組成一個「細胞句子」,其中包含 [CLS] 標記(作為最終的細胞嵌入)與 [DS] 標記(用於分離資料集特定效應)。
  4. Expression Modulation:為了納入基因表達的大小,使用「soft binning」演算法與兩個 MLP 產生表達編碼,並將其加至每個基因嵌入,類似於位置嵌入的方式。

SE 透過對每個細胞隨機遮蔽 1,280 個基因,並要求模型預測這些基因來進行訓練。

評估指標

提交的作品將依據三項主要指標進行評估:

Perturbation Discrimination(PDisc)

此指標評估模型辨識擾動之相對差異的能力。它計算預測轉錄組與真實值之曼哈頓距離,並與預測轉錄組與測試集中所有其他擾動轉錄組之距離作比較。結果正規化至 0 代表完美匹配的尺度,最終分數以 PDiscNorm = 1 - 2 * PDisc 正規化。

Differential Expression(DE)

Differential Expression 衡量模型正確辨識為顯著受影響之真實受影響基因的比例。其流程包括:

  • 針對預測與真實分佈分別使用帶有平局校正的 Wilcoxon 秩和檢定計算 p 值。
  • 套用 Benjamini‑Hochberg 程序調整 p 值,以降低偽陽性。
  • 計算預測之差異表達基因與真實集合的交集,並以真實差異表達基因的數量作正規化。

Mean Average Error

此指標提供模型預測平均誤差的直接量測。

Sources