usadellab/Helixer

Using Deep Learning to predict gene annotations

解决的问题

Helixer 执行 ab initio 结构基因组注释(也称为“基因预测”)。它识别基因组序列中哪些特定碱基对属于基因的不同部分,特别是非翻译区(UTR)、编码序列(CDS)和内含子,从而帮助研究人员为不同物种生成初级基因模型。

工作原理

Helixer 将深度神经网络与隐马尔可夫模型(HMM)结合,以预测基因结构。该过程通常分为三个步骤:

  1. 数据转换:将 FASTA 格式的 DNA 序列转换为数值矩阵。
  2. 推理:使用特定版本的深度学习模型(已针对真菌、陆生植物、脊椎动物和无脊椎动物训练)预测每个碱基对属于基因间区域、UTR、CDS 或内含子的概率。
  3. 后处理:将这些概率处理为初级基因模型,并导出为 GFF3 文件。

适用人群

专为需要对不同谱系(真菌、植物、脊椎动物和无脊椎动物)物种进行基因组注释的生物信息学家和基因组研究人员设计。

主要亮点

  • 谱系特异性模型:提供针对四大主要生物谱系的预训练模型。
  • 高性能:针对 GPU 加速(Nvidia 和 Apple Silicon)进行了优化,可处理现实规模的数据集。
  • 灵活部署:支持命令行工具、Docker/Singularity 容器、Web 工具和 Galaxy 安装等多种形式。
  • 可重现性:包含 --deterministic 标志,确保在不同 GPU 架构间结果一致。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目