ArcInstitute/state
State is a machine learning model that predicts cellular perturbation response across diverse contexts
What it solves
State 提供了一个框架,用于预测细胞在不同生物背景下如何对扰动(例如基因变化)做出反应。它允许研究人员建模细胞状态转换,并创建细胞数据的高维嵌入,以更好地理解生物反应。
How it works
该项目实施了两种主要的模型类型:
State Transition (ST) Models: 这些模型经过训练来预测扰动的结果。工作流程包括预处理原始细胞数据(归一化计数并选择高变异基因),使用特定的数据集配置进行模型训练,然后对新数据进行推理或评估。
State Embedding (SE) Models: 这些模型经过预训练来创建细胞的嵌入。过程包括构建数据剖面,拟合嵌入模型,并将新数据集转换到嵌入空间。这些嵌入可以存储在向量数据库(如 LanceDB)中,以进行相似性查询。
Who it’s for
它是为计算生物学家和处理单细胞数据的研究人员设计的,他们需要预测基因扰动效应或使用预训练的细胞嵌入来注释新数据集。
Highlights
Perturbation Prediction: 预测细胞对基因扰动反应的能力。
Embedding Generation: 用于预训练和应用细胞嵌入模型进行数据集注释的工具。
Vector Database Integration: 对 LanceDB 的可选支持,用于存储和查询细胞嵌入。
Flexible Configuration: 使用 Hydra 和 TOML 文件来管理复杂的数据集划分,包括 zero-shot 和 few-shot 场景。
相关
- Dispatch
- 项目
- 项目
- 项目
- Dispatch