cafferychen777/mLLMCelltype

Cell type annotation for single-cell RNA-seq using multi-LLM consensus

解决的问题

mLLMCelltype 解决了单细胞RNA测序(scRNA-seq)数据中自动化细胞类型注释的挑战。传统上,从基因表达数据中识别细胞类型可能存在错误,或依赖于特定参考数据集。该框架通过在多个大语言模型(LLM)之间采用基于共识的方法,减少了单模型的偏差和错误。

工作原理

该工具接收每个细胞簇的标记基因(差异表达基因),并使用多种大语言模型(如 GPT、Claude、Gemini 等)预测细胞类型。它不依赖单一模型,而是实现了一种共识框架,多个模型分析数据并整合其预测结果。该过程包括多轮迭代讨论,模型评估证据并精炼注释,并提供一致性比例和香农熵等不确定性度量,以标记不可靠的预测。

适用人群

专为使用 Scanpy(Python)或 Seurat(R)等平台,并需要一种无需参考数据的方法来注释细胞群体的单细胞转录组学和生物信息学研究人员设计。

主要亮点

  • 多LLM共识:整合10+个LLM提供商的预测,相比单模型基线显著提升准确性。
  • 无参考数据:无需预训练或外部参考数据集即可注释细胞类型。
  • 迭代优化:模型进行多轮讨论以精炼结果。
  • 不确定性量化:提供指标以识别和验证不确定的注释。
  • 跨平台支持:通过专用 Python 和 R 包,完全集成到 Scanpy 和 Seurat 工作流中。
  • 广泛模型兼容:支持 OpenAI、Anthropic、Google、DeepSeek 和 OpenRouter 等多种提供商。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目