treeverse/dvc
🦉 Data Versioning and ML Experiments
解決的問題
DVC(資料版本控制)解決了機器學習專案中的可重現性挑戰。它允許開發者對大型資料集和機器學習模型進行版本管理——這些檔案太大,無法用 Git 管理——同時將版本控制的元資料保留在 Git 中,確保程式碼、資料和模型的特定版本始終相互關聯。
工作原理
DVC 作為 Git 的一層封裝。它將實際的資料和模型檔案儲存在 Git 儲存庫之外的獨立快取中,而 Git 中只保留輕量級的佔位檔案。為了共享和備份該快取,DVC 支援多種遠端儲存平台,包括 S3、Azure、Google Cloud,以及透過 SSH 連接的內部網路儲存。
它還提供了一種定義計算圖(管道)的系統,將程式碼與資料連結起來。這些管道指定了每個步驟的相依性與輸出,使 DVC 只執行受變更影響的步驟。
適用對象
需要追蹤實驗、版本化資料和模型,並協作建立可重現的機器學習管道的機器學習工程師與資料科學家。
主要亮點
- 資料版 Git:無需專用伺服器即可版本化和共享資料製品和模型。
- 輕量級管道:僅執行受變更影響的步驟的版本化資料管道。
- 本地實驗追蹤:在本地 Git 儲存庫中直接追蹤和比較超參數、指標和效能圖表。
- 雲端儲存整合:與 S3、Azure 和 GCS 等雲端供應商無縫推送和拉取資料。
- VS Code 延伸模組:在 IDE 內部提供實驗追蹤和資料管理的圖形介面。
相關
- 專案
- 專案
- 專案
- 專案
- 專案