usadellab/Helixer
Using Deep Learning to predict gene annotations
解決的問題
Helixer 執行 ab initio 結構基因組註釋(亦稱為「基因呼叫」)。它識別基因組序列中哪些特定鹼基對屬於基因的不同部分,特別是非翻譯區(UTR)、編碼序列(CDS)和內含子,讓研究人員能為各種物種生成初步基因模型。
工作原理
Helixer 將深度神經網絡與隱馬可夫模型(HMM)結合,以預測基因結構。此過程通常分為三個步驟:
- 資料轉換:將 FASTA 格式的 DNA 序列轉換為數值矩陣。
- 推論:使用特定版本的深度學習模型(已針對真菌、陸生植物、脊椎動物和無脊椎動物訓練)預測每個鹼基對屬於基因間區域、UTR、CDS 或內含子的機率。
- 後處理:將這些機率處理為初步基因模型,並匯出為 GFF3 檔案。
適用對象
專為需要對不同譜系(真菌、植物、脊椎動物和無脊椎動物)物種進行基因組註釋的生物資訊學家與基因組研究人員設計。
主要亮點
- 譜系特異性模型:提供針對四大主要生物譜系的預訓練模型。
- 高效率:針對 GPU 加速(Nvidia 與 Apple Silicon)進行優化,可處理現實規模的資料集。
- 彈性部署:支援命令列工具、Docker/Singularity 容器、Web 工具與 Galaxy 安裝等多種形式。
- 可重現性:包含
--deterministic標誌,確保在不同 GPU 架構間結果一致。
相關
- 專案
- 專案
- 專案
- 專案
- 專案