kedro-org/kedro

Kedro is a toolbox for production-ready data science. It uses software engineering best practices to help you create data engineering and data science pipelines that are reproducible, maintainable, and modular.

해결하는 문제

Kedro는 데이터 과학 및 데이터 엔지니어링 프로젝트를 일회성 스크립트나 Jupyter 노트북에서 본격적인, 유지보수 가능한, 재현 가능한 코드로 전환하도록 설계되었습니다. '접착 코드'(glue-code)의 단점을 보완하고, 소프트웨어 엔지니어링 역량이 다른 팀원들이 모듈성과 관심사의 분리를 강제함으로써 더 효과적으로 협업할 수 있도록 도와줍니다.

작동 방식

Kedro는 데이터 파이프라인에 소프트웨어 엔지니어링의 최선의 실천 방법을 적용하는 구조화된 프레임워크를 제공합니다. Cookiecutter Data Science 기반의 프로젝트 템플릿을 사용하여 프로젝트 구조를 표준화합니다. 다양한 파일 형식과 클라우드 스토어에 대한 로드/세이브 작업을 추상화하는 데이터 카탈로그와, Python 함수 간의 종속성을 자동으로 해결하여 모듈식 워크플로우를 생성하는 파이프라인 추상화 기능을 제공합니다.

대상 사용자

대량의 원시 데이터를 처리하고, 확장 가능하며 재현 가능한 분석 파이프라인과 실제 세계의 머신러닝 애플리케이션을 구축해야 하는 데이터 과학자 및 데이터 엔지니어.

주요 기능

  • 데이터 카탈로그: 로컬, 네트워크, 클라우드 객체 스토어 간 데이터 저장 및 로드를 위한 가벼운 커넥터와 내장된 버전 관리 기능.
  • 파이프라인 추상화: Python 함수 간 종속성 자동 해결 및 Kedro-Viz를 통한 시각화 지원.
  • 유연한 배포: 단일 또는 분산 머신, Argo, Prefect, Kubeflow, AWS Batch, Databricks 등의 오케스트레이션 도구 지원.
  • 표준화된 코딩 규칙: 테스트, 문서화, 린팅을 위한 pytest, Sphinx, ruff 통합 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트