cafferychen777/mLLMCelltype

Cell type annotation for single-cell RNA-seq using multi-LLM consensus

何を解決するか

mLLMCelltype は、単一細胞RNAシークエンシング(scRNA-seq)データにおける自動細胞型アノテーションの課題に対処します。従来、遺伝子発現データから細胞型を特定することは、誤りが生じやすく、特定のリファレンスデータセットに依存する傾向がありました。このフレームワークは、複数の大規模言語モデル(LLM)間でコンセンサスを取るアプローチにより、単一モデルのバイアスや誤りを低減します。

動作方法

このツールは、各細胞クラスタのマーカー遺伝子(発現が有意に異なる遺伝子)を入力として受け取り、GPT、Claude、Geminiなど多様なLLMを用いて細胞型を予測します。単一モデルに依存するのではなく、複数のモデルがデータを分析し、その予測を統合するコンセンサスフレームワークを実装しています。プロセスには、モデルが証拠を評価し、アノテーションを精緻化するための反復的な議論ラウンドが含まれており、信頼性の低い予測を特定するための不確実性指標(コンセンサス割合、シャノンエントロピー)も提供します。

対象ユーザー

Scanpy(Python)やSeurat(R)などのプラットフォームを活用し、細胞集団をアノテーションする必要がある単一細胞トランスクリプトミクスおよびバイオインフォマティクスの研究者向けに設計されています。

特徴

  • マルチLLMコンセンサス:10以上のLLMプロバイダーの予測を統合し、単一モデルベースラインよりも精度を向上。
  • リファレンスフリー:事前学習や外部リファレンスデータセットを必要とせず、細胞型をアノテーション可能。
  • 反復的精緻化:複数ラウンドの検討を通じて結果を改善。
  • 不確実性の定量化:不確実なアノテーションを特定・検証するための指標を提供。
  • クロスプラットフォーム対応:専用のPythonおよびRパッケージにより、ScanpyおよびSeuratワークフローと完全統合。
  • 広範なモデル互換性:OpenAI、Anthropic、Google、DeepSeek、OpenRouterなど、多数のプロバイダーをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト