projectglow/glow
An open-source toolkit for large-scale genomic analysis
何を解決するか
このツールは、バイオインフォマティクスとSparkエコシステムの間のギャップを埋めることで、バイオバンク規模およびそれ以上のスケールでの大規模な遺伝子データ解析を可能にします。従来のツールでは処理が困難な巨大な遺伝子データセットを扱えるようにします。
動作方法
Glowは遺伝子データ処理をApache Sparkに統合し、VCF、BGEN、Plinkなどの遺伝子ファイルを分散型DataFramesに読み込むことを可能にします。ユーザーはPython、SQL、R、Java、ScalaでSpark SQL APIを使用してクエリや解析を実行できます。また、既存のコマンドラインツールやPandas関数を並列化してワークフローをスケーリングするためのツールも提供しています。
対象ユーザー
巨大な遺伝子データセット、電子健康記録、医療画像を扱うバイオインフォマティシャンやデータサイエンティストで、分散コンピューティングエンジンのスケーラビリティを必要とする人。
主な特徴
- VCF、BGEN、Plinkファイルを分散型DataFramesに読み込むサポート。
- データ品質管理、データ操作、バリアント正規化、liftOverのための組み込み関数。
- 全ゲノム関連解析(GWAS)の実行が可能。
- ポピュレーションストラティフィケーションにSpark MLライブラリとの統合。
- Python、SQL、R、Java、Scalaを含む複数言語のサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト