Arc 가상 세포 챌린지 프라이머

Arc 가상 세포 챌린지는 CRISPR를 사용해 특정 유전자를 침묵시켰을 때의 효과를 부분적으로 보지 못한 세포 유형에서 예측할 수 있는 모델을 개발하는 대회이며, 이러한 작업은 컨텍스트 일반화(context generalization)라고 불립니다. 궁극적인 목표는 파라미터 변화를 시뮬레이션하여 세포 반응을 예측할 수 있는 “가상 세포”를 만드는 것으로, 비용이 많이 들고 오류가 발생하기 쉬운 물리적 실험에 대한 의존도를 줄여 약물 발견을 가속화할 수 있습니다.

훈련 데이터 및 모델링 제약

챌린지는 약 30만 개의 단일 세포 RNA 시퀀싱 프로파일로 구성된 정제된 데이터셋을 활용합니다. 훈련 세트는 22만 개의 세포를 포함하며, 각 세포는 전사체—해당 유전자의 RNA 분자 원시 카운트를 담은 희소 행 벡터—로 표현됩니다. 이 중 약 3만 8천 개의 세포는 교란되지 않은(대조) 세포로, 비교를 위한 필수 기준선 역할을 합니다.

전사체학에서의 관찰자 효과

전사체를 읽는 과정에서 세포가 파괴된다는 사실 때문에 세포 변화를 예측하는 것이 복잡해집니다. 교란 전후에 동일한 세포에서 측정을 할 수 없기 때문에 연구자들은 기준(교란되지 않은) 세포 집단을 참조로 사용해야 합니다. 이는 생물학적 이질성과 기술적 노이즈를 도입하며, 이는 교란의 실제 신호와 분리되어야 합니다. 교란된 세포에서 관찰되는 유전자 발현은 교란의 실제 효과, 기준 집단의 생물학적 이질성, 그리고 실험별 기술적 노이즈의 합으로 모델링됩니다.

STATE 기본 모델

Arc는 STATE라는 기본 솔루션을 제공했으며, 이는 두 개의 트랜스포머 기반 모델인 State Embedding Model (SE)와 State Transition Model (ST)을 사용합니다.

State Transition Model (ST)

State Transition Model은 세포 시뮬레이터 역할을 합니다. Llama 백본을 사용하며 두 가지 입력을 받습니다: 공변량이 일치하는 기준 세포들의 전사체 집합(또는 SE 임베딩)과 유전자 교란을 나타내는 원-핫 벡터. 이러한 입력은 GELU 활성화를 갖는 독립적인 4계층 MLP 인코더를 통과합니다. 모델이 전체 전사체를 생성하는 경우, 출력은 학습된 디코더를 거칩니다. ST는 Maximum Mean Discrepancy를 사용해 예측 결과와 실제 결과의 확률 분포 차이를 최소화하도록 학습됩니다.

State Embedding Model (SE)

State Embedding Model은 BERT와 유사한 오토인코더로, 교차 세포 유형 일반화를 향상시키기 위해 의미론적 세포 임베딩을 생성하도록 설계되었습니다. 과정은 여러 단계로 이루어집니다:

  1. Gene Embeddings: 모델은 유전자의 모든 단백질 이소폼에 대한 아미노산 서열을 얻어 ESM2(15B 파라미터 단백질 언어 모델)를 통해 처리합니다. 이를 평균 풀링하여 전사체 임베딩을 만들고, 다시 평균 풀링하여 유전자 임베딩을 생성합니다.
  2. Projection: 유전자 임베딩은 LayerNormSiLU 활성화를 갖는 학습된 인코더를 사용해 모델 차원으로 투사됩니다.
  3. Cell Sentences: 각 세포는 로그 폴드 발현 수준에 따라 상위 2048개의 유전자로 표현됩니다. 이러한 유전자 임베딩은 [CLS] 토큰(최종 세포 임베딩으로 사용)과 [DS] 토큰(데이터셋 특이 효과를 분리하는 데 사용)을 포함하는 “cell sentence”로 구성됩니다.
  4. Expression Modulation: 유전자 발현의 크기를 반영하기 위해 “soft binning” 알고리즘과 두 개의 MLP가 발현 인코딩을 생성하고, 이를 각 유전자 임베딩에 추가합니다. 이는 위치 임베딩과 유사합니다.

SE는 각 세포당 1,280개의 유전자를 마스킹하고, 모델이 이를 예측하도록 학습됩니다.

평가 지표

제출물은 세 가지 주요 지표를 기준으로 평가됩니다.

Perturbation Discrimination (PDisc)

이 지표는 모델이 교란 간의 상대적 차이를 얼마나 잘 식별하는지를 평가합니다. 예측된 전사체와 실제 전사체 사이의 Manhattan 거리를 계산하고, 이를 테스트 세트 내 다른 교란 전사체와의 거리와 비교합니다. 결과는 0이 완벽한 일치를 의미하는 스케일로 정규화되며, 최종 점수는 PDiscNorm = 1 - 2 * PDisc 형태로 정규화됩니다.

Differential Expression (DE)

Differential Expression은 실제로 영향을 받은 유전자 중 모델이 유의하게 영향을 받았다고 올바르게 식별한 비율을 측정합니다. 과정은 다음과 같습니다:

  • 예측된 분포와 실제 분포에 대해 tie correction을 포함한 Wilcoxon rank-sum 검정을 통해 p-value를 계산합니다.
  • Benjamini-Hochberg 절차를 적용해 p-value를 조정하고 false positive를 감소시킵니다.
  • 예측된 차등 발현 유전자와 실제 차등 발현 유전자 집합의 교집합을 구하고, 이를 실제 차등 발현 유전자 수로 정규화합니다.

Mean Average Error

이 지표는 모델 예측의 평균 오류를 간단히 측정합니다.

Sources