Arc バーチャルセルチャレンジ プライマー

Arc Virtual Cell Challenge は、部分的に未見の細胞タイプにおいて CRISPR を用いて特定の遺伝子をサイレンシングした際の効果を予測できるモデルを開発する競技です。このタスクはコンテキスト一般化と呼ばれます。最終目標は、パラメータ変化に対する細胞応答をシミュレートできる「バーチャルセル」を作成し、高価でエラーが起きやすい実験に依存することを減らすことで、創薬を加速させることです。

トレーニングデータとモデリングの制約

このチャレンジでは、約 300,000 件のシングルセル RNA シーケンシングプロファイルからなるキュレーション済みデータセットが使用されます。トレーニングセットは 220,000 個の細胞を含み、各細胞はトランスクリプトーム(対応遺伝子の RNA 分子の生カウントを含む疎な行ベクトル)で表現されます。この中で約 38,000 個の細胞は非摂動(コントロール細胞)であり、比較のための基本的なベースラインとして機能します。

トランスクリプトミクスにおける観測者効果

細胞のトランスクリプトームを読むことは細胞を破壊するため、細胞変化の予測は複雑になります。摂動前後の同一細胞から測定を取ることができないため、研究者は基底(非摂動)細胞群を参照として使用せざるを得ません。これにより生物学的ヘテロジニティと技術的ノイズが混入し、実際の摂動シグナルから分離しなければなりません。摂動細胞で観測される遺伝子発現は、摂動の真の効果、基底集団の生物学的ヘテロジニティ、実験固有の技術的ノイズの合計としてモデル化されます。

STATE ベースラインモデル

Arc は STATE と呼ばれるベースラインソリューションを提供しています。これは二つのトランスフォーマーベースのモデル、State Embedding Model (SE) と State Transition Model (ST) を使用します。

State Transition Model (ST)

State Transition Model は細胞シミュレータとして機能します。Llama バックボーンを使用し、二つの入力を受け取ります:共変量でマッチした基底細胞のトランスクリプトーム(または SE 埋め込み)セットと、遺伝子摂動を表すワンホットベクトルです。これらの入力は独立した 4 層 MLP エンコーダ(GELU 活性化)を通ります。モデルが完全なトランスクリプトームを生成する場合、出力は学習されたデコーダを通ります。ST は Maximum Mean Discrepancy を用いて、予測結果と実測結果の確率分布間の差異を最小化するように学習されます。

State Embedding Model (SE)

State Embedding Model は BERT ライクなオートエンコーダで、クロス細胞タイプ一般化を改善するための意味的細胞埋め込みを作成します。プロセスは以下のステップで構成されます。

  1. 遺伝子埋め込み: モデルは遺伝子のすべてのタンパク質アイソフォームのアミノ酸配列を取得し、ESM2(15B パラメータの Protein Language Model)を通して処理します。これらは平均プーリングされてトランスクリプト埋め込みが作られ、さらに平均プーリングされて遺伝子埋め込みが生成されます。
  2. 射影: 遺伝子埋め込みは、LayerNorm と SiLU 活性化を備えた学習エンコーダを用いてモデル次元に射影されます。
  3. セル文: 各細胞は、対数発現レベルで上位 2048 個の遺伝子で表されます。これらの遺伝子埋め込みは、[CLS] トークン(最終的な細胞埋め込みとして使用)と [DS] トークン(データセット固有効果を分離するために使用)を含む「セル文」に構築されます。
  4. 発現調整: 遺伝子発現の大きさを組み込むために、「ソフトビニング」アルゴリズムと二つの MLP が発現エンコーディングを生成し、各遺伝子埋め込みに加算されます(位置埋め込みに類似)。

SE は各細胞につき 1,280 個の遺伝子をマスクし、モデルにそれらを予測させることで学習されます。

評価指標

提出物は以下の三つの主要指標で評価されます。

Perturbation Discrimination (PDisc)

この指標は、モデルが摂動間の相対的な違いをどれだけ正確に識別できるかを評価します。予測トランスクリプトームと真実トランスクリプトーム間のマンハッタン距離を、予測トランスクリプトームとテストセット内の他のすべての摂動トランスクリプトームとの距離と比較して算出します。結果は 0 が完全一致を表すスケールに正規化され、最終スコアは PDiscNorm = 1 - 2 * PDisc として正規化されます。

Differential Expression (DE)

Differential Expression は、モデルが真に影響を受けた遺伝子を有意に影響があると正しく識別できた割合を測定します。手順は次の通りです。

  • 予測分布と真実分布の両方に対して、ウィルコクソン順位和検定(タイ補正あり)で p 値を算出。
  • ベンジャミニ・ホックバーグ手法で p 値を調整し、偽陽性を削減。
  • 予測された差次的に発現した遺伝子と真実集合の交差を、真の差次的に発現した遺伝子数で正規化して計算。

Mean Average Error

この指標は、モデル予測の平均誤差を直接的に測定します。

Sources