kedro-org/kedro
Kedro is a toolbox for production-ready data science. It uses software engineering best practices to help you create data engineering and data science pipelines that are reproducible, maintainable, and modular.
何を解決するか
Kedroは、データサイエンスおよびデータエンジニアリングプロジェクトを一時的なスクリプトやJupyterノートブックから、本番環境対応で保守可能かつ再現可能なコードへと移行することを目的としています。『グルーコード』の欠点を補い、ソフトウェアエンジニアリングスキルの異なるチームメンバーがモジュール性と責任の分離を強制することで、より効果的に協働できるように支援します。
動作方法
Kedroは、データパイプラインにソフトウェアエンジニアリングのベストプラクティスを適用する構造化されたフレームワークを提供します。Cookiecutter Data Scienceに基づくプロジェクトテンプレートを使用して、プロジェクトの構造を標準化しています。データカタログにより、さまざまなファイル形式やクラウドストアに対する読み込み/保存操作を抽象化し、パイプライン抽象化によりPython関数間の依存関係を自動的に解決し、モジュール性の高いワークフローを構築します。
対象ユーザー
大量の生データを扱うスケーラブルで再現可能な分析パイプラインや実世界のMLアプリケーションを構築する必要があるデータサイエンティストおよびデータエンジニア。
主な特徴
- データカタログ: ローカル、ネットワーク、クラウドオブジェクトストア間でデータの保存・読み込みを行う軽量なコネクタと、組み込みのバージョニング機能。
- パイプライン抽象化: Python関数間の依存関係を自動的に解決し、Kedro-Vizによる可視化をサポート。
- 柔軟なデプロイ: 単一マシンまたは分散マシンの両方に対応。Argo、Prefect、Kubeflow、AWS Batch、Databricksなどのオーケストレーションツールもサポート。
- 標準化されたコーディング規約: テスト、ドキュメント、Lintingのためのpytest、Sphinx、ruffを統合サポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト