cafferychen777/mLLMCelltype
Cell type annotation for single-cell RNA-seq using multi-LLM consensus
해결하는 문제
mLLMCelltype은 단일 세포 RNA 시퀀싱(scRNA-seq) 데이터에서 자동 세포 유형 주석화의 과제를 해결합니다. 기존에는 유전자 발현 데이터에서 세포 유형을 식별하는 것이 오류가 많거나 특정 참조 데이터셋에 의존하는 경향이 있었습니다. 이 프레임워크는 여러 대규모 언어 모델(LLM) 간의 합의 기반 접근법을 통해 단일 모델의 편향과 오류를 줄입니다.
작동 방식
이 도구는 각 세포 클러스터의 마커 유전자(차별적으로 발현되는 유전자)를 입력으로 받아, GPT, Claude, Gemini 등 다양한 LLM을 사용하여 세포 유형을 예측합니다. 단일 모델에 의존하는 것이 아니라, 여러 모델이 데이터를 분석하고 예측을 통합하는 합의 프레임워크를 구현합니다. 반복적인 토론 라운드를 통해 모델들이 증거를 평가하고 주석을 정교화하며, 신뢰할 수 없는 예측을 경고하기 위한 불확실성 지표(합의 비율, 샤논 엔트로피)도 제공합니다.
대상 사용자
Scanpy(파이썬) 또는 Seurat(R)과 같은 플랫폼을 사용하고, 참조 데이터셋 없이 세포 집단을 주석화할 필요가 있는 단일 세포 전사체학 및 생정보학 연구자들을 위한 것입니다.
주요 특징
- 다중 LLM 합의: 10개 이상의 LLM 제공업체의 예측을 통합하여 단일 모델 기반보다 정확도를 향상.
- 참조 데이터 없음: 사전 훈련이나 외부 참조 데이터셋 없이 세포 유형을 주석화 가능.
- 반복적 정교화: 모델들이 여러 라운드의 논의를 통해 결과를 개선.
- 불확실성 정량화: 불확실한 주석을 식별하고 검증하기 위한 지표 제공.
- 다중 플랫폼 지원: 전용 Python 및 R 패키지를 통해 Scanpy 및 Seurat 워크플로우와 완전 통합.
- 광범위한 모델 호환성: OpenAI, Anthropic, Google, DeepSeek, OpenRouter 등 다양한 제공업체 지원.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트