OpenDCAI/DataFlow
Easy Data Preparation with latest LLMs-based Operators and Pipelines.
解決的問題
DataFlow 是一個以數據為中心的 AI 系統,旨在將雜訊原始數據(如 PDF、純文字和低品質 QA 對)轉換為用於大型語言模型 (LLM) 的高品質訓練數據集。它解決了醫療、金融、法律和學術研究等領域中,手動數據清洗和合成所耗費的時間與成本問題。
工作原理
該系統採用「基於算子」的設計,將單個數據處理任務(生成、評估、過濾和精煉)封裝為算子。隨後,這些算子被編排成可復現且可共享的流水線。
核心組件包括:
- Operators: 接收結構化輸入 (JSON, JSONL, CSV) 並生成處理後輸出的模組化單元。
- Pipelines: 定義特定數據工作流(例如 Text, Reasoning, Text2SQL 和 Knowledge Base Cleaning)的算子序列。
- DataFlow-WebUI: 一個視覺化的低程式碼工作區,可以透過拖放或自然語言構建並執行這些流水線。
- DataFlow-Agent: 一個智慧助手,可以分析數據、編寫自定義算子並自動組裝流水線。
適用對象
DataFlow 專為需要大規模準備用於預訓練 (Pre-training)、監督式微調 (SFT)、RL 訓練或 RAG 系統的高品質數據的 AI 研究人員與企業而構建。
亮點
- 低程式碼編排: 透過 WebUI 進行視覺化流水線構建,實現更快的實驗。
- 開箱即用的流水線: 為文本、數學、程式碼以及從 PDF 中提取結構化數據而預建的工作流。
- 類 PyTorch 結構: 採用 Pipeline $ ightarrow$ Operator $ ightarrow$ Prompt 的層級化組織方式,實現清晰的工作流控制。
- 分散式擴展: 集成 RayOrch,實現大規模數據任務的高效能編排。
相關
- 專案
- 專案
- 專案
- 專案
- 專案