data-prep-kit/data-prep-kit
Open source project for data preparation for GenAI applications
何を解決するか
Data-Prep-Kit は、大規模言語モデル(LLM)向けに非構造化データを準備する複雑なプロセスを簡素化します。事前学習、ファインチューニング、インストラクションチューニング、または検索拡張生成(RAG)アプリケーションの構築に使用されるデータのクリーニング、変換、拡張をスケーラブルに実現します。
仕組み
このキットは、自然言語、コード、画像に適用可能なモジュール式の変換処理の拡張可能なライブラリで構成されています。Python と Ray に基づいて構築されており、単一のラップトップからフルデータセンターまでスケーリング可能です。Parquet、ZIP、NDJSON、JSONL などのさまざまなファイル形式をサポートしています。複雑なワークフローには、Kubernetes クラスタ上でジョブとして変換をデプロイするか、Tekton パイプラインで順序付けを行うことができます。
対象ユーザー
モデル学習や RAG パイプライン向けに大量の非構造化データを処理する必要がある LLM アプリケーション開発者。
特徴
- マルチモーダル対応:自然言語、コード、画像データを処理可能。
- スケーラブルなアーキテクチャ:Python と Ray の両方のランタイムをサポートし、大規模なスケーリングを実現。
- モジュール式の変換ライブラリ:HTML から Parquet へのインジェスト、重複削除(正確および曖昧)、品質アノテーション、PII 削除、言語識別などのツールを含む。
- エンタープライズ対応のデプロイ:Kubernetes および Tekton パイプラインと互換性があり、自動化が可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト