ArcInstitute/state
State is a machine learning model that predicts cellular perturbation response across diverse contexts
What it solves
State 提供了一個框架,用於預測細胞在不同生物背景下如何對擾動(例如基因變更)做出反應。它允許研究人員建模細胞狀態轉換,並為細胞數據建立高維嵌入,以更好地理解生物反應。
How it works
該專案實作了兩種主要的模型類型:
- State Transition (ST) Models: 這些模型旨在預測擾動的結果。工作流程包括預處理原始細胞數據(正規化計數並選擇高變異基因),使用特定的數據集配置進行模型訓練,然後對新數據進行推理或評估。
- State Embedding (SE) Models: 這些模型經過預訓練,用於生成細胞的嵌入。過程包括建立數據剖面、擬合嵌入模型,然後將新數據集轉換為嵌入空間。這些嵌入可以存儲在向量數據庫(例如 LanceDB)中,以便進行相似性查詢。
Who it’s for
它是為計算生物學家和處理單細胞數據的研究人員設計的,這些研究人員需要預測基因擾動效應或使用預訓練的細胞嵌入來標註新數據集。
Highlights
- Perturbation Prediction: 預測細胞對基因擾動反應的能力。
- Embedding Generation: 用于預訓練和應用細胞嵌入模型以進行數據集標註的工具。
- Vector Database Integration: 對 LanceDB 的可選支持,用於存儲和查詢細胞嵌入。
- Flexible Configuration: 使用 Hydra 和 TOML 文件來管理複雜的數據集分割,包括 zero-shot 和 few-shot 場景。
相關
- Dispatch
- 專案
- 專案
- 專案
- Dispatch