data-prep-kit/data-prep-kit

Open source project for data preparation for GenAI applications

解決的問題

Data-Prep-Kit 簡化了為大型語言模型(LLMs)準備非結構化資料的複雜流程。它提供了一種可擴展的方式,用於清理、轉換和豐富用於預訓練、微調、指令微調或建構檢索增強生成(RAG)應用的資料。

工作原理

此工具包由一個持續擴展的模組化轉換程式庫組成,可應用於自然語言、程式碼和影像。這些轉換基於 Python 與 Ray 建構,使處理過程可從單一筆電擴展至整個資料中心。該框架支援 Parquet、ZIP、NDJSON 與 JSONL 等多種檔案格式。對於複雜的工作流程,轉換可作為工作部署於 Kubernetes 集群上,或使用 Tekton 管道進行序列化。

適用對象

需要處理大量非結構化資料以用於模型訓練或 RAG 流水線的 LLM 應用開發者。

主要亮點

  • 多模態支援:處理自然語言、程式碼與影像資料。
  • 可擴展架構:支援 Python 僅執行與 Ray 執行環境,實現大規模擴展。
  • 模組化轉換程式庫:包含資料攝取(例如 HTML 轉 Parquet)、去重(精確與模糊)、品質標註、PII 隱私資訊遮蔽與語言識別等工具。
  • 企業級部署:與 Kubernetes 與 Tekton 管道相容,支援自動化。

相關

  • 專案
  • 專案
  • 專案
  • 專案