ArcInstitute/state

State is a machine learning model that predicts cellular perturbation response across diverse contexts

What it solves

State는 다양한 생물학적 맥락에서 세포가 섭동(유전적 변화 등)에 어떻게 반응하는지 예측하는 프레임워크를 제공합니다. 연구자들은 세포 상태 전이를 모델링하고 세포 데이터의 고차원 임베딩을 생성하여 생물학적 반응을 더 잘 이해할 수 있습니다.

How it works

이 프로젝트는 두 가지 주요 모델 유형을 구현합니다:

  1. State Transition (ST) Models: 이 모델들은 섭동의 결과를 예측하도록 학습됩니다. 워크플로우는 원시 세포 데이터를 전처리(카운트 정규화 및 고변이 유전자 선택)하고, 특정 데이터셋 구성으로 모델을 학습시킨 후, 새로운 데이터에 대해 추론 또는 평가를 수행합니다.

  2. State Embedding (SE) Models: 이 모델들은 세포 임베딩을 생성하기 위해 사전 학습됩니다. 이 프로세스는 데이터 프로필을 구축하고, 임베딩 모델을 피팅하고, 새로운 데이터셋을 임베딩 공간으로 변환하는 과정을 포함합니다.

이 임베딩은 유사성 쿼리를 위해 벡터 데이터베이스(LanceDB와 같은)에 저장할 수 있습니다.

Who it’s for

이 프로젝트는 유전적 섭동 효과를 예측하거나 사전 학습된 세포 임베딩을 사용하여 새로운 데이터셋을 주석을 달아야 하는 계산 생물학자 및 단일 세포 데이터를 다루는 연구자들을 위해 설계되었습니다.

Highlights

  • Perturbation Prediction: 유전적 섭동에 대한 세포의 반응을을 예측하는 모델을 학습할 수 있는 능력.

  • Embedding Generation: 데이터셋 주석을 위한 세포 임베딩 모델을 사전 학습하고 적용하는 도구.

  • Vector Database Integration: 세포 임베딩을 저장하고 쿼리하기 위한 LanceDB에 대한 선택적 지원. n

  • Flexible Configuration: Hydra와 TOML 파일을 사용하여 zero-shot 및 few-shot 시나리오를 포함한 복잡한 데이터셋 분할을 관리합니다.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch