cafferychen777/mLLMCelltype
Cell type annotation for single-cell RNA-seq using multi-LLM consensus
What it solves
mLLMCelltype는 단일 세포 RNA 시퀀싱 (scRNA-seq) 데이터의 세포 유형 주석 프로세스를 자동화하기 위해 설계되었습니다. 전통적으로 유전자 발현 데이터에서 세포 유형을 식별별하는 것은 수동적이거나 레퍼런스에 의존하는 프로세스입니다. 이 도구는 대규모 언어 모델 (LLMs)의 내재된 지식을 활용하여 사전 학습이나 레퍼런스 데이터셋의 필요성을 제거합니다.
How it works
이 프레임워크워크는 여러 LLM (GPT, Claude, Gemini, Qwen 등)이 동일한 마커 유전자 목록을 분석하는 합의 기반 접근 방식을 사용합니다. 단일 모델에 의존하는 대신, 여러 모델의 예측을 통합하여 편향과 오류를를 ลดong(reduce)를 줄입니다. 프로세스는 다음과 같습니다:
- Iterative Discussion: LLM은 여러 차례의 심의를 통해 증거를 평가하고 주석을 정교화합니다.
- Uncertainty Quantification: 시스템은 Consensus Proportion과 Shannon Entropy를 계산하여 모델 간의 의견이 일치하지 않는 주석을 표시합니다.
- Integration: Scanpy (Python) 및 Seurat (R)와 직접적으로 연동됩니다.
Who it's for
더 정확하고 자동화된, 레퍼런스 프리(reference-free) 방식의 세포 클러스터 주석을 원하는 단일 세포 전사체학 분석을 수행하는 생물정보학자 및 연구자들을 위한 도구입니다.
Highlights
- Multi-Model Consensus: 10개 이상의 LLM 제공업체를 결합하여 단일 모델 베이스라인보다 정확도를 향기상시킵니다.
- Reference-Free: 외부 레퍼런스 데이터셋을 требуется(requires)를 요구하지 않고 세포 유형을 주석 처리합니다.
- Cross-Annotation Support: R 및 Python 패키지로 제공되며 브라우저 기반의 웹 애플리케이션이 포함되어 있습니다.
- Transparency: 각 주석에 대해 LLM이 사용한 전체 추론 과정을 기록합니다.