usadellab/Helixer
Using Deep Learning to predict gene annotations
解决的问题
Helixer 执行 ab initio 结构基因组注释(也称为“基因预测”)。它识别基因组序列中哪些特定碱基对属于基因的不同部分,特别是非翻译区(UTR)、编码序列(CDS)和内含子,从而帮助研究人员为不同物种生成初级基因模型。
工作原理
Helixer 将深度神经网络与隐马尔可夫模型(HMM)结合,以预测基因结构。该过程通常分为三个步骤:
- 数据转换:将 FASTA 格式的 DNA 序列转换为数值矩阵。
- 推理:使用特定版本的深度学习模型(已针对真菌、陆生植物、脊椎动物和无脊椎动物训练)预测每个碱基对属于基因间区域、UTR、CDS 或内含子的概率。
- 后处理:将这些概率处理为初级基因模型,并导出为 GFF3 文件。
适用人群
专为需要对不同谱系(真菌、植物、脊椎动物和无脊椎动物)物种进行基因组注释的生物信息学家和基因组研究人员设计。
主要亮点
- 谱系特异性模型:提供针对四大主要生物谱系的预训练模型。
- 高性能:针对 GPU 加速(Nvidia 和 Apple Silicon)进行了优化,可处理现实规模的数据集。
- 灵活部署:支持命令行工具、Docker/Singularity 容器、Web 工具和 Galaxy 安装等多种形式。
- 可重现性:包含
--deterministic标志,确保在不同 GPU 架构间结果一致。
相关
- 项目
- 项目
- 项目
- 项目
- 项目