Hugging Face Summer 2021 Update

TL;DR

Hugging Face 在 2021 年夏季通过推出用于托管 ML 演示的 Spaces、将 TensorBoard 和评估指标集成到 Hub 中以及推出用于硬件加速的 Optimum 库来扩展其生态系统。这些更新,加上对 JAX/Flax 的扩展支持和新的无分词器模型,旨在降低部署和共享最先进机器学习模型的门槛。

Hub Feature Enhancements

Spaces Beta

Spaces 提供了一种免费解决方案,可直接在用户或组织资料上托管机器学习演示应用程序。它支持 Gradio 和 Streamlit SDK,使用户能够在几分钟内部署基于 Python 的应用程序。主要功能包括:

  • 用于安全部署的密钥管理。
  • 用于依赖处理的自定义需求。
  • 通过 GitHub 仓库直接管理。

Model Visibility and Tracking

  • TensorBoard 集成:Hub 现在会自动为任何包含 TensorBoard traces 的仓库启动免费的 TensorBoard 实例,支持公共和私有仓库。
  • 评估指标:用户现在可以在模型卡的 model-index 部分列出评估指标。这些指标会自动链接到对应的 Papers With Code 排行榜,以便进行社区横向比较。
  • 社交功能:已为模型、数据集和 Spaces 实现点赞系统,以促进社区发现。

Interactive Browser Widgets

现在有 18 个小部件允许用户在浏览器中测试模型。最近的新增内容包括:

  • Sentence Transformers:特征提取和句子相似度小部件。
  • 音频分类:支持语言识别、街道声音检测、命令识别和说话人识别。
  • 计算机视觉:文本到图像、图像分类和目标检测小部件(例如,支持 Google 的 ViT 和 Facebook AI 的 DETR)。
  • 结构化数据:Scikit-learn 分类的早期演示。

Open Source Library Updates

Transformers

Transformers 库已获得 50,000 颗星和 3000 万次下载。主要更新包括:

  • 框架支持:JAX/Flax 现在是第三个受支持的框架,Hub 上有超过 5,000 个模型。TensorFlow 示例已重新编写,以提高鲁棒性和符合惯用法的使用。
  • 模型新增
    • DETR:端到端目标检测和图像分割。
    • ByT5 和 CANINE:无分词器模型,直接在字节或字符上运行。
    • HuBERT:用于情感和命令识别的高级音频任务性能。
    • LayoutLMv2 和 LayoutXLM:通过结合文本、布局和视觉数据来解析文档图像的模型。
    • BEiT:自监督视觉变换器。
    • RemBERT:在零样本迁移中表现优于 XLM-R 的大型多语言 Transformer。
    • Splinter:仅用 128 个示例在 SQuAD 上达到约 73% F1 的少样本问答模型。
  • Hub 集成Trainer API 现在可以在检查点保存期间直接将配置、模型和分词器文件推送到 Hub。新的 transformers.onnx 模块改进了模型导出到 ONNX。

Datasets

Dataset Hub 现在托管 1,400 个公开数据集。新亮点包括用于编码任务的 Microsoft CodeXGlue,以及诸如 C4 和 MC4 之类的大规模数据集。该库现在支持 JAX、parquet 文件、远程文件以及诸如自动语音识别之类的扩展领域。

Ecosystem Integration

Hub 通过 huggingface_hub 库扩展了与其他 ML 库的合作伙伴关系:

  • spaCy:所有规范管道都可在官方 spaCy 组织中获得,并且可以通过单个命令共享。
  • Sentence Transformers:现在 Hub 上有超过 200 个模型可用。
  • 其他库:Adapter Transformers 和 Speechbrain 模型的集成。

Enterprise and Production Solutions

Hardware Acceleration and Optimum

Hugging Face 与 Intel、Qualcomm 和 GraphCore 合作推出了 Optimum,这是一个开源的 ML 优化工具包,专为生产性能而设计。

Deployment and Inference

  • 在 SageMaker 上进行推理:与 AWS 的新集成允许用户使用 Hub 模型页面上直接找到的代码片段在 SageMaker 上部署 Transformers 模型。
  • AutoNLP:一个无代码的网页界面现在允许用户直接从浏览器在自己的数据上训练、评估和部署 Transformers 模型。
  • 推理 API:新的集成包括用于 Python 代码注释的 VSCode 扩展、用于应用自动化的 Zapier 连接(例如,针对 Twitter 提及的 Slack 警报)以及用于零样本分类的 Google Sheets 脚本。
  • Infinity:一个即将推出的解决方案,专为在私有基础设施中高效部署而设计,声称在 GPU 上对类似 BERT 的模型延迟为 1ms,在 CPU 上为 4-10ms。

Research and Community Initiatives

BigScience and Collaborative Training

  • BigScience:在 Jean Zay 上完成了 13B 英文-only 解码器模型的首次大规模训练,第二阶段请求的预算为 250 万 GPU 小时。
  • DeDLOC:与 Yandex 研究共同开发的一种协作训练方法,允许在可访问的资源(例如 Colab、Kaggle)上训练大型网络,而无需 HPC 集群。这被用于训练 sahajBERT,一种孟加拉语言模型。

Academic Contributions

  • NAACL 最佳论文:论文《How Many Data Points is a Prompt Worth?* 获得最佳论文奖,表明人工编写的提示可以替代数千个监督数据点。
  • EMNLP 论文:四篇论文被接受,涵盖 Datasets 社区库、基于提示的微调启发式以及用于更快 Transformers 的块剪枝(在 SQuAD 上产生比 BERT 快 2.4 倍且小 74% 的模型)。

Education

  • Hugging Face 课程:推出了一门免费在线课程,涵盖 Transformers、Tokenizers、Datasets、Accelerate 和 Hub。
  • JAX/FLAX Sprint:一个社区活动,有 800 名参与者,产生了超过 170 个模型、22 个数据集和 38 个 Spaces 演示,包括 Dall-e mini、DietNerf 和 CLIP RSIC。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch