data-prep-kit/data-prep-kit

Open source project for data preparation for GenAI applications

何を解決するか

Data-Prep-Kit は、大規模言語モデル(LLM)向けに非構造化データを準備する複雑なプロセスを簡素化します。事前学習、ファインチューニング、インストラクションチューニング、または検索拡張生成(RAG)アプリケーションの構築に使用されるデータのクリーニング、変換、拡張をスケーラブルに実現します。

仕組み

このキットは、自然言語、コード、画像に適用可能なモジュール式の変換処理の拡張可能なライブラリで構成されています。Python と Ray に基づいて構築されており、単一のラップトップからフルデータセンターまでスケーリング可能です。Parquet、ZIP、NDJSON、JSONL などのさまざまなファイル形式をサポートしています。複雑なワークフローには、Kubernetes クラスタ上でジョブとして変換をデプロイするか、Tekton パイプラインで順序付けを行うことができます。

対象ユーザー

モデル学習や RAG パイプライン向けに大量の非構造化データを処理する必要がある LLM アプリケーション開発者。

特徴

  • マルチモーダル対応:自然言語、コード、画像データを処理可能。
  • スケーラブルなアーキテクチャ:Python と Ray の両方のランタイムをサポートし、大規模なスケーリングを実現。
  • モジュール式の変換ライブラリ:HTML から Parquet へのインジェスト、重複削除(正確および曖昧)、品質アノテーション、PII 削除、言語識別などのツールを含む。
  • エンタープライズ対応のデプロイ:Kubernetes および Tekton パイプラインと互換性があり、自動化が可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト