datajuicer/data-juicer

Data processing for and with foundation models! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷

解決的問題

Data-Juicer 解決了在為基礎模型準備數據集時遇到的「原始數據混亂」問題。它提供了一個可擴展、可組合的基礎設施,將雜亂無章的數據轉換為用於預訓練、微調和 RAG 應用的高品質、AI 就緒的智能數據。

工作原理

該系統採用由 200 多個算子(operator)組成的模組化架構,可以將它們鏈接成透過 YAML 定義的可復現流水線(recipe)。它支持包括文本、圖像、音訊、影片和多模態數據在內的各種數據模態。對於大規模工作負載,它利用 Ray 等分散式執行框架在數千個核心上處理海量數據集。

適用對象

  • AI 研究員:需要高品質預訓練或微調語料庫的基座模型構建者。
  • 機器學習工程師:需要清洗交互軌跡或構建上下文結構的代理系統或 RAG 流水線開發者。
  • 數據科學家:處理多模態數據(影片、音訊等)並需要相機標定或姿勢估計等專業處理的用戶。

亮點

  • 模組化架構:針對文本、圖像、音訊、影片和多模態數據的 200 多個算子。
  • 可擴展性能:在 6400 核集群上可在 2 小時內處理 700 億個樣本。
  • 配方驅動:可版本化和共享的可復現 YAML 流水線。
  • 多模態支持:包括用於具身智能(Embodied AI)、影片理解和語義 LLM 提取的專用算子。
  • 生產就緒:與 Alibaba Cloud PAI 集成,並支持透過 Ray 進行分散式執行。