Hugging Face AI Sheets 发布
Hugging Face AI Sheets 是一款开源的无代码工具,旨在使用 AI 模型构建、丰富和转换数据集。它使用户能够通过推理提供者或本地部署,利用 Hugging Face Hub 上的数千个开放模型,包括来自 OpenAI 的 gpt-oss 等模型。
使用 AI Sheets 进行无代码数据集工程
AI Sheets 提供类似电子表格的用户界面,允许用户通过编写提示词来创建新的数据列。这种方式有助于快速实验,用户可以先使用小数据集并迭代提示词,然后再扩展到更大的数据生成流水线。
核心功能
- 模型比较与“氛围测试”: 用户可以导入提示词并创建多个列——每个模型对应一列,以并排比较输出。通过添加一个“评审”列,让另一个 LLM 对响应进行评估,可进一步扩展此功能。
- 提示词优化: 该工具支持高效的提示词微调。通过编辑单元格或用“点赞”标记,用户提供直接反馈,工具会自动将其作为少量示例用于后续生成。
- 数据集转换与分类: AI Sheets 可用于清理文本(例如,去除标点符号)、对内容进行分类或从数据集中提取关键要点。
- 数据丰富: 启用“搜索网络”选项后,用户可以使用模型查找缺失信息,例如特定地址的邮政编码。
- 合成数据生成: 用户可以通过自然语言描述所需结构,或通过链式提示(例如,先生成专业简介,再使用该简介撰写真实的电子邮件),从零创建全新数据集。
工作流与技术实现
AI Sheets 支持两种主要的数据入口:导入现有文件(XLS、TSV、CSV 或 Parquet),最多 1,000 行;或使用自然语言描述从零生成数据集。
精炼与扩展
加载数据后,用户可以通过多种机制对输出进行精炼:
- 手动反馈: 编辑单元格或点赞结果可作为模型在重新生成或添加新行时的少量示例。
- 列配置: 用户可以修改提示词、切换模型或更改推理提供者,以优化性能。
- 动态扩展: 用户可以从列的最后一个单元格向下拖动,即时生成更多行。
Hub 集成与扩展
在 AI Sheets 中创建的数据集可以导出到 Hugging Face Hub。此导出会生成一个配置文件(config.yml),保存提示词和少量示例。随后可使用 HF Jobs 以及提供的扩展脚本,基于该配置进行大规模数据生成,处理超出初始电子表格限制的更大量数据。
部署与访问
AI Sheets 可通过 Hugging Face Spaces 免费使用,也可通过其 GitHub 仓库在本地部署。对于本地用户,Hugging Face 建议订阅 PRO 以提升每月推理使用额度。