OpenDCAI/DataFlow

Easy Data Preparation with latest LLMs-based Operators and Pipelines.

解決する課題

DataFlowは、ノイズの多い生データ(PDF、プレーンテキスト、低品質なQAペアなど)を、大規模言語モデル(LLM)向けの高品質なトレーニングデータセットに変換するために設計されたデータ中心型AIシステムです。医療、金融、法律、学術研究などの分野における、手動でのデータクリーニングおよび合成に伴う時間とコストの問題を解決します。

仕組み

本システムは「オペレーターベース」の設計を採用しており、個々のデータ処理タスク(生成、評価、フィルタリング、洗練)がオペレーターとしてカプセル化されています。これらのオペレーターは、再現可能で共有可能なパイプラインとしてオーケストレーションされます。

主なコンポーネントは以下の通りです:

  • Operators: 構造化された入力(JSON, JSONL, CSV)を受け取り、処理済みの出力を生成するモジュール式ユニット。
  • Pipelines: 特定のデータワークフロー(例:Text, Reasoning, Text2SQL, Knowledge Base Cleaning)を定義するオペレーターのシーケンス。
  • DataFlow-WebUI: ドラッグ&ドロップまたは自然言語を使用して、これらのパイプラインを構築・実行するための視覚的なローコード・ワークスペース。
  • DataFlow-Agent: データの分析、カスタムオペレーターの作成、パイプラインの自動組み立てが可能なインテリジェント・アシスタント。

対象ユーザー

DataFlowは、事前学習(Pre-training)、教師あり微調整(SFT)、RLトレーニング、またはRAGシステム向けに、高品質なデータの準備をスケールアップする必要があるAI研究者や企業向けに構築されています。

ハイライト

  • ローコード・オーケストレーション: WebUIによる視覚的なパイプラインビルダーにより、迅速な実験が可能。
  • すぐに使えるパイプライン: テキスト、数学、コード、およびPDFからの構造化データ抽出のための事前構築済みワークフロー。
  • PyTorchライクな構造: 明確なワークフロー制御のための、階層的な Pipeline $ ightarrow$ Operator $ ightarrow$ Prompt 構成。
  • 分散スケーリング: 大規模なデータタスクの高性能なオーケストレーションのための RayOrch との統合。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト