usadellab/Helixer
Using Deep Learning to predict gene annotations
해결하는 문제
Helixer는 ab initio 구조적 게놈 어노테이션(또는 '유전자 호출'이라고도 함)을 수행합니다. 특정 게놈 서열 내에서 어떤 염기쌍이 유전자의 다양한 부분(비번역 영역(UTR), 번역 영역(CDS), 인트론 등)에 속하는지 식별하여 다양한 종에 대한 기본 유전자 모델을 생성할 수 있게 해줍니다.
작동 방식
Helixer는 딥 뉴럴 네트워크와 숨겨진 마르코프 모델(HMM)을 결합하여 유전자 구조를 예측합니다. 일반적으로 다음 세 단계로 진행됩니다:
- 데이터 변환: FASTA 형식의 DNA 서열이 수치 행렬로 변환됩니다.
- 추론: 특정 버전의 딥러닝 모델(진균, 육상 식물, 척추동물, 무척추동물용으로 훈련된 버전)이 각 염기쌍이 유전자 간 영역, UTR, CDS, 또는 인트론에 속할 확률을 기반 단위로 예측합니다.
- 후처리: 이러한 확률은 기본 유전자 모델로 변환되어 GFF3 파일로 내보냅니다.
대상 사용자
진균, 식물, 척추동물, 무척추동물 등 다양한 계통의 종에 대해 게놈 어노테이션을 수행해야 하는 생물정보학자 및 게놈 연구자들을 위한 도구입니다.
주요 특징
- 계통별 모델: 네 가지 주요 생물 계통에 맞게 최적화된 사전 훈련된 모델 제공.
- 고성능: Nvidia 및 Apple Silicon GPU 가속을 최적화하여 현실적인 크기의 데이터셋을 처리 가능.
- 유연한 배포: 명령줄 도구, Docker/Singularity 컨테이너, 웹 도구, Galaxy 설치 버전으로 제공.
- 재현성:
--deterministic플래그를 통해 다양한 GPU 아키텍처 간에 일관된 결과를 보장.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트