projectglow/glow

An open-source toolkit for large-scale genomic analysis

解决的问题

它通过弥合生物信息学与 Spark 生态系统之间的差距,使生物银行规模及更大规模的基因组分析成为可能。它允许研究人员处理原本超出传统工具处理能力的海量基因组数据集。

工作原理

Glow 将基因组数据处理集成到 Apache Spark 中,使基因组文件(如 VCF、BGEN 和 Plink)能够加载到分布式 DataFrame 中。用户可以使用 Python、SQL、R、Java 和 Scala 的 Spark SQL API 执行查询和分析。它还提供工具,将现有的命令行工具和 Pandas 函数并行化,以扩展工作流。

适用人群

需要分布式计算引擎可扩展性的生物信息学家和数据科学家,他们处理大规模基因组数据集、电子健康记录和医学影像。

主要亮点

  • 支持将 VCF、BGEN 和 Plink 文件加载到分布式 DataFrame 中。
  • 内置用于质量控制、数据操作、变异标准化和 liftOver 的函数。
  • 可执行全基因组关联分析(GWAS)。
  • 与 Spark ML 库集成,用于人群分层分析。
  • 支持多种语言,包括 Python、SQL、R、Java 和 Scala。

相关

  • 项目
  • 项目
  • 项目
  • 项目