Hugging Face AI Sheets 视觉更新

Hugging Face 已发布 AI Sheets 的重要更新,这是一款开源工具,旨在使用开放的 AI 模型在无需编写代码的情况下构建、转换和丰富数据集。主要新增功能是全面的视觉支持,使用户能够在电子表格工作流中直接分析、提取数据并生成视觉内容。

基于视觉的数据提取与分析

AI Sheets 允许用户上传图像或使用基于图像的数据集,通过视觉模型提取并结构化信息。这一能力将非结构化的视觉数据——如收据、产品目录和扫描文档——转化为有序的表格。

关键功能包括:

  • 结构化数据提取:用户可以使用自定义提示从收据中提取特定项目、从图表中获取数据,或从扫描文档中提取文本。
  • 图像描述与分类:该工具可以为照片生成标题、对文档类型进行分类,或根据内容为图像打标签。
  • 元数据生成:模型可以自动为图像标注质量评分、相关属性或自定义注释。

用户可以通过迭代提示、手动编辑结果,并使用“点赞”机制向模型提供少量示例,以提升准确性。

集成图像生成与编辑

除了提取,AI Sheets 还集成了图像到图像和文本到图像模型,以在电子表格中促进内容创作。

  • 文本到图像生成:用户可以基于文本列创建社交媒体图形、缩略图或插图(例如,根据食谱标题生成食物照片)。
  • 图像转换:可以对已有图像进行风格更改、添加元素或调整构图。
  • 图像变体:该工具支持大规模创建视觉的多个版本,以用于测试和品牌推广。

技术实现与模型灵活性

AI Sheets 利用 Hugging Face 推理提供者,向用户提供数千个开源模型的访问权限。这使得用户可以根据任务的具体需求更换模型,在速度和准确性之间取得平衡。

在一个提取手写食谱文本的示例中,工具展示了不同模型层级的差异:

  • Qwen/Qwen2.5-VL-7B-Instruct:作为默认模型,兼顾速度和准确性。
  • Qwen/Qwen3-VL-235B-A22B-Reasoning:最先进的推理模型,在检测细微细节方面更为准确,例如特定配料(如“菠菜”)和精确烹饪时间(如“50-60 分钟”),而较小的模型则会漏掉这些信息。

工作流与导出选项

AI Sheets 的工作流遵循从数据摄取到最终导出的线性路径:

  1. 上传:用户上传图像文件夹或连接数据集。
  2. AI 操作:用户对列应用操作。图像列支持文本提取、目标检测和上色,而文本列支持摘要、翻译和关键词提取。
  3. 丰富:提取的文本可以进一步处理(例如,将原始转录转换为结构化 HTML)。
  4. 导出:最终数据集可以以 CSV 或 Parquet 格式导出到 Hugging Face Hub(公开或私有)。

AI Sheets 可作为托管的 Space 直接使用,也可以通过其 GitHub 仓库在本地部署。

Sources