usadellab/Helixer

Using Deep Learning to predict gene annotations

何を解決するか

Helixer は ab initio 構造ゲノムアノテーション(「遺伝子コール」とも呼ばれる)を実行します。特定のゲノム配列における塩基対が、非翻訳領域(UTR)、コード領域(CDS)、イントロンなど、遺伝子のどの部分に属するかを特定し、さまざまな種に対して一次遺伝子モデルを生成できるようにします。

動作方法

Helixer は深層ニューラルネットワークと隠れマルコフモデル(HMM)を組み合わせて遺伝子構造を予測します。通常は以下の3ステップで行われます:

  1. データ変換:FASTA形式のDNA配列が数値行列に変換されます。
  2. 推論:深層学習モデル(真菌、陸上植物、脊椎動物、無脊椎動物用に特定のバージョンで訓練済み)が、各塩基対が遺伝子間領域、UTR、CDS、またはイントロンに属する確率をベース単位で予測します。
  3. 後処理:これらの確率は一次遺伝子モデルに変換され、GFF3形式でエクスポートされます。

対象ユーザー

真菌、植物、脊椎動物、無脊椎動物など、さまざまな系統の種のゲノムアノテーションが必要なバイオインフォマティシャンやゲノム研究者向けに設計されています。

特徴

  • 系統特異的モデル:4つの主要な生物学的系統に特化した事前学習済みモデルを提供。
  • 高性能:NvidiaおよびApple Silicon対応のGPU加速を最適化し、現実的なサイズのデータセットを処理可能。
  • 柔軟なデプロイ:コマンドラインツール、Docker/Singularityコンテナ、ウェブツール、Galaxyインストールのいずれでも利用可能。
  • 再現性--deterministic フラグにより、異なるGPUアーキテクチャ間でも一貫した結果を保証。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト