datajuicer/data-juicer
Data processing for and with foundation models! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
解決的問題
Data-Juicer 是一個全面的資料處理系統,旨在將原始、混亂的資料轉換為高品質、AI 就緒的資料集。它解決了為基礎模型準備大規模資料的挑戰,包括跨多種模態(文字、影像、音訊、視訊)的清理、去重和合成。
運作方式
該系統將資料處理視為可組合的基礎架構。它採用模組化架構,包含超過 200 個運算子,這些運算子可以串聯成可重現的管線,並透過 YAML 配方定義。這些管線可以從單一台筆記型電腦擴展到千節點叢集,使用 Ray 進行分散式執行,並具備自動運算子融合和 CUDA 加速等最佳化功能,以處理 PB 級的資料集。
適用對象
它專為需要策劃預訓練語料庫、準備微調或 RL 資料、清理代理互動軌跡,或建構特定領域 RAG 索引的 AI 研究人員和工程師而打造。
亮點
- 多模態支援:用於文字、影像、音訊、視訊和具身 AI (VLA) 資料的運算子。
- 配方優先的工作流程:可重現的基於 YAML 的管線,可進行版本控制與共享。
- 雲原生擴展:與 Ray 深度整合,對數十億個樣本進行高效能分散式處理。
- 豐富的運算子庫:超過 200 個內建運算子,用於過濾、映射和分析。
- Juicer 模型:一個可本地部署的資料精煉模型,遵循自然語言指令進行清理和標記。
相關
- 專案
- 專案
- 專案
- 專案
- 專案