Hugging Face 与 Renumics Spotlight 集成以实现可扩展的数据检查

Hugging Face 与 Renumics Spotlight 已集成,使机器学习从业者能够用一行代码交互式地探索和可视化数据集。此集成通过在 Hugging Face datasets 库与交互式可视化工具之间架起桥梁,简化了识别关键数据簇和故障模式的过程。

与 Hugging Face Datasets 的无缝集成

Spotlight 设计为直接在 Hugging Face datasets 库之上工作,消除了数据复制或预处理的需求。它利用该库使用 Apache Arrow 表来统一存储表格元数据和非结构化数据(如图像和音频)。

Key technical characteristics of the integration include:

  • Lazy Loading: 为了保持性能,Spotlight 将表格数据加载到内存中以进行高效的客户端分析,同时按需惰性加载内存密集型的非结构化样本(视频、音频、图像)。
  • Automatic Type Inference: 在大多数情况下,数据类型和标签映射会从数据集特征中自动推断出来。对于不明确的情况,Spotlight API 允许手动分配数据类型,例如 spotlight.Imagespotlight.dtypes.CategoryDType
  • Minimal Setup: 用户可以通过加载数据集并调用 spotlight.show(ds) 来启动可视化。

利用模型结果进行数据检查

原始非结构化数据通常只能提供有限的洞察。为了发现关键数据段和模型失效模式,Spotlight 允许用户直接将模型输出(如预测和嵌入)集成到可视化工作流中。

模型丰富工作流

从业者可以使用 transformers 库计算嵌入和预测,然后使用 .map() 函数将这些结果存储回 Hugging Face 数据集。这个“丰富”数据集随后可以使用特定的 Spotlight 布局进行可视化,例如 debug_classification 布局,该布局提供诸如相似性图和混淆矩阵之类的工具来分析模型性能。

数据存储建议

Hugging Face 建议将预测结果直接存储在 Hugging Face 数据集中,以保持标签映射并利用该库的批处理能力。

自定义数据检查工作流

Spotlight 提供 GUI 和 Python API 两种方式来自定义数据检查方式:

  • GUI 自定义: 用户可以在界面内交互式地更改、保存和加载可视化布局。
  • 检查器小部件: 一个专门的小部件,能够表示多模态数据,包括时间序列、音频、视频、文本和图像。
  • Python API: 该 API 允许创建用于探索性数据分析(EDA)、模型监控和模型调试的自定义策展工作流。它还可以通过数据问题小部件集成外部数据质量检查脚本的结果。

在 Hugging Face Hub 上部署

除了本地使用之外,Spotlight 可视化可以通过 Hugging Face Spaces 在 Hugging Face Hub 上托管。这使得开发者可以向其他用户展示他们的数据集或模型结果。用户可以复制现有的 Spotlight 示例空间,并通过指定 HF_DATASET 环境变量来指向自己的数据集(包括特定的划分、子集或修订版)进行配置。

Sources