cafferychen777/mLLMCelltype

Cell type annotation for single-cell RNA-seq using multi-LLM consensus

What it solves

mLLMCelltype 是為了自動化單細胞 RNA 定序 (scRNA-seq) 數據中的細胞類型註釋過程而設計的。

傳統上,從基因表達數據中識別細胞類型是一個手動或依賴參考數據的過程;此工具透過利用大型語言模型 (LLMs) 中嵌入的知識,消除了對預訓練或參考數據集的需要。

How it works

該框架使用基於共識的方法,其中多個 LLM (例如 GPT, Claude, Gemini, 和 Qwen) 分析相同的標記基因列表。

而不是依賴單一模型,它整合了來自多個模型的預測,以減少偏差和錯誤。

該過程包括:

  • Iterative Discussion: LLM 會透過多輪審議來評估證據並完善其註釋。
  • Uncertainty Quantification: 系統會計算 Consensus Proportion 和 Shannon Entropy,以標記模型之間存在分歧的註釋。
  • Integration: 它直接與常見的單細胞分析平台,如 Scanpy (Python) 和 Seurat (R) 配合使用。

Who it's for

此工具旨在用於正在進行單細胞轉錄組學分析的生物資訊學家和研究人員,他們希望有一種更準確、自動化且無參考的細胞簇註釋方式。

Highlights

  • Multi-Model Consensus: 結合了 10+ LLM 提供商,以提高相對於單一模型的基準線準度。
  • Reference-Free: 在不需要外部參考數據集的狀況下進行細胞類型註釋。
  • Cross-Platform Support: 作為 R 和 Python 套件提供,並附帶基於瀏覽器的 Web 應用程式。
  • Transparency: 記錄了 LLM 在每次註釋時所使用的完整推理過程。