projectglow/glow

An open-source toolkit for large-scale genomic analysis

解決的問題

它透過彌合生物資訊學與 Spark 生態系統之間的差距,使生物銀行規模及更大規模的基因組分析成為可能。它讓研究人員能夠處理原本超出傳統工具處理能力的龐大基因組資料集。

工作原理

Glow 將基因組資料處理整合至 Apache Spark 中,使基因組檔案(如 VCF、BGEN 和 Plink)能夠載入到分散式 DataFrame 中。使用者可使用 Python、SQL、R、Java 和 Scala 的 Spark SQL API 進行查詢與分析。它也提供工具,將現有的命令列工具與 Pandas 函數平行化,以擴展工作流程。

適用對象

需要分散式運算引擎可擴展性的生物資訊學家與資料科學家,他們處理大型基因組資料集、電子健康紀錄與醫學影像。

主要亮點

  • 支援將 VCF、BGEN 和 Plink 檔案載入到分散式 DataFrame 中。
  • 內建用於品質控制、資料操作、變異標準化與 liftOver 的函數。
  • 可執行全基因組關聯分析(GWAS)。
  • 與 Spark ML 套件整合,用於族群分層分析。
  • 支援多種語言,包括 Python、SQL、R、Java 與 Scala。

相關

  • 專案
  • 專案
  • 專案
  • 專案