projectglow/glow

An open-source toolkit for large-scale genomic analysis

何を解決するか

このツールは、バイオインフォマティクスとSparkエコシステムの間のギャップを埋めることで、バイオバンク規模およびそれ以上のスケールでの大規模な遺伝子データ解析を可能にします。従来のツールでは処理が困難な巨大な遺伝子データセットを扱えるようにします。

動作方法

Glowは遺伝子データ処理をApache Sparkに統合し、VCF、BGEN、Plinkなどの遺伝子ファイルを分散型DataFramesに読み込むことを可能にします。ユーザーはPython、SQL、R、Java、ScalaでSpark SQL APIを使用してクエリや解析を実行できます。また、既存のコマンドラインツールやPandas関数を並列化してワークフローをスケーリングするためのツールも提供しています。

対象ユーザー

巨大な遺伝子データセット、電子健康記録、医療画像を扱うバイオインフォマティシャンやデータサイエンティストで、分散コンピューティングエンジンのスケーラビリティを必要とする人。

主な特徴

  • VCF、BGEN、Plinkファイルを分散型DataFramesに読み込むサポート。
  • データ品質管理、データ操作、バリアント正規化、liftOverのための組み込み関数。
  • 全ゲノム関連解析(GWAS)の実行が可能。
  • ポピュレーションストラティフィケーションにSpark MLライブラリとの統合。
  • Python、SQL、R、Java、Scalaを含む複数言語のサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト