Hugging Face 與 Renumics Spotlight 整合,實現可擴展的資料檢查

Hugging Face 與 Renumics Spotlight 已整合,使機器學習從業者能夠以單行代碼互動式探索和視覺化資料集。此整合透過橋接 Hugging Face datasets 庫與互動式視覺化工具之間的差距,簡化了識別關鍵資料叢集和失敗模式的過程。

與 Hugging Face Datasets 無縫整合

Spotlight 設計為直接建置在 Hugging Face datasets 庫之上,免除資料複製或預處理的需求。它利用該庫使用 Apache Arrow 表格來統一格式存儲表格元資料和非結構化資料(如圖像和音訊)。

Key technical characteristics of the integration include:

  • Lazy Loading: 為維持效能,Spotlight 將表格資料載入記憶體以進行高效的客戶端分析,同時在需要時惰性載入記憶體密集型的非結構化樣本(視訊、音訊、圖像)。
  • Automatic Type Inference: 在大多數情況下,資料類型和標籤映射會從資料集特徵自動推斷。對於不明確的情況,Spotlight API 允許手動指定資料類型,例如 spotlight.Imagespotlight.dtypes.CategoryDType
  • Minimal Setup: 使用者可透過載入資料集並呼叫 spotlight.show(ds) 來啟動視覺化。

利用模型結果進行資料檢查

原始非結構化資料常提供有限的見解。為了發掘關鍵資料段落和模型失敗模式,Spotlight 允許使用者直接將模型輸出(如預測和嵌入)整合到視覺化工作流程中。

模型豐富工作流程

從業者可以使用 transformers 庫計算嵌入和預測,然後透過 .map() 函數將這些結果存回 Hugging Face 資料集。此「豐富」資料集接著可使用特定的 Spotlight 佈局進行視覺化,例如 debug_classification 佈局,該佈局提供相似度圖和混淆矩陣等工具來分析模型效能。

資料儲存建議

Hugging Face 建議將預測結果直接存放在 Hugging Face 資料集內,以保持標籤映射並利用該庫的批次處理能力。

自訂資料檢查工作流程

Spotlight 提供 GUI 與 Python API 兩種方式來自訂資料檢查方式:

  • GUI Customization: 使用者可在介面中互動式變更、儲存和載入視覺化佈局。
  • Inspector Widget: 一種專門的小工具,能夠表示多模態資料,包括時間序列、音訊、視訊、文字和圖像。
  • Python API: 該 API 允許建立自訂的資料策展工作流程,用於探索性資料分析(EDA)、模型監控和模型除錯。它也能透過資料問題小工具整合外部資料品質檢查腳本的結果。

在 Hugging Face Hub 上部署

除了本地使用外,Spotlight 視覺化可透過 Hugging Face Spaces 在 Hugging Face Hub 上託管。這使開發者能向其他使用者展示他們的資料集或模型結果。使用者可以複製現有的 Spotlight 範例空間,並透過指定 HF_DATASET 環境變數來指向自己的資料集(包括特定的分割、子集或修訂版)進行配置。

Sources