projectglow/glow

An open-source toolkit for large-scale genomic analysis

해결하는 문제

이 도구는 생물정보학과 Spark 생태계 사이의 격차를 메우면서, 생물은행 규모 이상의 대규모 유전자 분석을 가능하게 합니다. 기존 도구로는 처리가 어려운 거대한 유전자 데이터셋을 다룰 수 있게 해줍니다.

작동 방식

Glow는 유전자 데이터 처리를 Apache Spark에 통합하여 VCF, BGEN, Plink 등의 유전자 파일을 분산형 DataFrame으로 로드할 수 있게 합니다. 사용자는 Python, SQL, R, Java, Scala로 Spark SQL API를 사용하여 쿼리와 분석을 수행할 수 있습니다. 또한 기존 명령줄 도구와 Pandas 함수를 병렬화하여 워크플로우를 확장할 수 있는 도구도 제공합니다.

대상 사용자

거대한 유전자 데이터셋, 전자 건강 기록, 의료 영상 등을 다루는 생물정보학자 및 데이터 과학자로, 분산 컴퓨팅 엔진의 확장성을 필요로 하는 사람들을 대상으로 합니다.

주요 기능

  • VCF, BGEN, Plink 파일을 분산형 DataFrame으로 로드하는 지원.
  • 품질 관리, 데이터 조작, 변이 정규화, liftOver를 위한 내장 함수.
  • 전장 연관 분석(GWAS) 수행 가능.
  • 인구 계층화를 위한 Spark ML 라이브러리와의 통합.
  • Python, SQL, R, Java, Scala를 포함한 다중 언어 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트