usadellab/Helixer

Using Deep Learning to predict gene annotations

解決的問題

Helixer 執行 ab initio 結構基因組註釋(亦稱為「基因呼叫」)。它識別基因組序列中哪些特定鹼基對屬於基因的不同部分,特別是非翻譯區(UTR)、編碼序列(CDS)和內含子,讓研究人員能為各種物種生成初步基因模型。

工作原理

Helixer 將深度神經網絡與隱馬可夫模型(HMM)結合,以預測基因結構。此過程通常分為三個步驟:

  1. 資料轉換:將 FASTA 格式的 DNA 序列轉換為數值矩陣。
  2. 推論:使用特定版本的深度學習模型(已針對真菌、陸生植物、脊椎動物和無脊椎動物訓練)預測每個鹼基對屬於基因間區域、UTR、CDS 或內含子的機率。
  3. 後處理:將這些機率處理為初步基因模型,並匯出為 GFF3 檔案。

適用對象

專為需要對不同譜系(真菌、植物、脊椎動物和無脊椎動物)物種進行基因組註釋的生物資訊學家與基因組研究人員設計。

主要亮點

  • 譜系特異性模型:提供針對四大主要生物譜系的預訓練模型。
  • 高效率:針對 GPU 加速(Nvidia 與 Apple Silicon)進行優化,可處理現實規模的資料集。
  • 彈性部署:支援命令列工具、Docker/Singularity 容器、Web 工具與 Galaxy 安裝等多種形式。
  • 可重現性:包含 --deterministic 標誌,確保在不同 GPU 架構間結果一致。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案