cafferychen777/mLLMCelltype

Cell type annotation for single-cell RNA-seq using multi-LLM consensus

What it solves

mLLMCelltypeは、シングルセルRNAシーケンシング (scRNA-seq) データにおける細胞型アノテーションのプロセスを自動化するために設計されています。従来、遺伝子発現データから細胞型を特定することは、手動またはリファレンス依存的なプロセスでした。このツールは、大規模言語モデル (LLMs) に組み込まれた知識を活用することで、事前学習やリファレンスデータセットの必要性を排除します。

How it works

このフレームワークは、複数のLLM (GPT, Claude, Gemini, Qwen など) が同じマーカー遺伝子リストを分析するコンセンサスベースのアプローチを採用しています。単一のモデルに依存するのではなく、複数のモデルからの予測をs統合し、バイアスやエラーを低減します。プロセスは以下の通りです:

  • Iterative Discussion: LLMは、複数回の検討を通じて、証拠を評価し、アノテーションを洗練させます。
  • Uncertainty Quantification: システムは、Consensus Proportion と Shannon Entropy を計算し、モデル間で意見が分かれるアノテーションをフラグ立てします。
  • Integration: Scanpy (Python) や Seurat (R) といった一般的なシングルセル解析プラットフォームと直接連携します。

Who it's for

シングルセルトランスクリプトミクス解析を行うバイオインフォマティシャンや研究者で、より正確で自動化された、リファレンスフリーのアノテーション方法を求めている方向けです。

Highlights

  • Multi-Model Consensus: 10以上のLLMプロバイダーを組み合わせ、単一モデルのベースラインと比較して精度を向上させます。
  • Reference-Free: 外部リファレンスデータセットを必要とせずに細胞型をアノテーションします。
  • Cross-Platform Support: R と Python パッケージとして利用可能で、ブラウザベースの Web アプリケーションも提供されています。
  • Transparency: 各アノテーションにおいて、LLMが使用した完全な推論プロセスを記録します。