OpenDCAI/DataFlow
Easy Data Preparation with latest LLMs-based Operators and Pipelines.
解決する課題
DataFlowは、ノイズの多い生データ(PDF、プレーンテキスト、低品質なQAペアなど)を、大規模言語モデル(LLM)向けの高品質なトレーニングデータセットに変換するために設計されたデータ中心型AIシステムです。医療、金融、法律、学術研究などの分野における、手動でのデータクリーニングおよび合成に伴う時間とコストの問題を解決します。
仕組み
本システムは「オペレーターベース」の設計を採用しており、個々のデータ処理タスク(生成、評価、フィルタリング、洗練)がオペレーターとしてカプセル化されています。これらのオペレーターは、再現可能で共有可能なパイプラインとしてオーケストレーションされます。
主なコンポーネントは以下の通りです:
- Operators: 構造化された入力(JSON, JSONL, CSV)を受け取り、処理済みの出力を生成するモジュール式ユニット。
- Pipelines: 特定のデータワークフロー(例:Text, Reasoning, Text2SQL, Knowledge Base Cleaning)を定義するオペレーターのシーケンス。
- DataFlow-WebUI: ドラッグ&ドロップまたは自然言語を使用して、これらのパイプラインを構築・実行するための視覚的なローコード・ワークスペース。
- DataFlow-Agent: データの分析、カスタムオペレーターの作成、パイプラインの自動組み立てが可能なインテリジェント・アシスタント。
対象ユーザー
DataFlowは、事前学習(Pre-training)、教師あり微調整(SFT)、RLトレーニング、またはRAGシステム向けに、高品質なデータの準備をスケールアップする必要があるAI研究者や企業向けに構築されています。
ハイライト
- ローコード・オーケストレーション: WebUIによる視覚的なパイプラインビルダーにより、迅速な実験が可能。
- すぐに使えるパイプライン: テキスト、数学、コード、およびPDFからの構造化データ抽出のための事前構築済みワークフロー。
- PyTorchライクな構造: 明確なワークフロー制御のための、階層的な Pipeline $ ightarrow$ Operator $ ightarrow$ Prompt 構成。
- 分散スケーリング: 大規模なデータタスクの高性能なオーケストレーションのための RayOrch との統合。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト