Hugging Face 课程第二部分及社区活动发布

Hugging Face 于 2021 年 11 月 15 日发布了 Hugging Face 课程的第二部分,并同步组织了一场社区活动,旨在提供技术培训和动手实践项目经验。此次发布将课程内容从基础的预训练模型使用扩展到了广泛的高级自然语言处理 (NLP) 任务和生态系统工具。

课程第二部分中扩展的 NLP 课程内容

Hugging Face 课程的第二部分将重点从第一部分的入门材料(涵盖使用预训练模型、针对文本分类进行微调以及上传至 Model Hub)转向更广泛的一系列常见 NLP 任务。新内容专门涵盖了:

  • Token Classification
  • Language Modeling (包括 causal 和 masked 变体)
  • Translation
  • Summarization
  • Question Answering

此外,课程还对 Hugging Face 生态系统进行了更深入的技术探索,特别强调了 datasetstokenizers 库。

社区活动结构与认证

为了支持课程发布,Hugging Face 组织了一场为期两天的活动,包括技术演讲随后是团队协作项目。参与者被要求在 NLP 任务上微调一个模型并创建实时演示 (demo)。

参与者的主要激励措施包括:

  • 作品集开发: 创建旨在用于专业 ML 作品集的实时演示。
  • 认证: 为成功构建了 demo 的参与者颁发结业证书。
  • 计算资源赞助: AWS 通过 Amazon SageMaker 提供免费的计算资源赞助了此次活动。

技术项目:第一天 - Transformers 与训练

活动的第一天侧重于 Transformer 模型的高层概念概述,以及用于训练或微调它们的方法论。演讲嘉宾阵容包括:

  • Thomas Wolf (Hugging Face): 讨论了迁移学习和 transformers 库的起源。
  • Margaret Mitchell: 介绍了机器学习开发中的价值观与伦理。
  • Jakob Uszkoreit (Inceptive): 探讨了当前模型的边界与潜在失效情况。
  • Jay Alammar (Cohere): 提供了 Transformer 架构的可视化介绍。
  • Matthew Watson and Chen Qian (Keras): 涵盖了使用 Keras 的 NLP 工作流。
  • Mark Saroufim (PyTorch): 详细介绍了使用 PyTorch 训练模型的流程。

技术项目:第二天 - 生态系统工具

第二天的重点是 Hugging Face、Gradio 和 AWS 工具的实际应用。会议涵盖了以下技术领域:

  • 训练优化: Lewis Tunstall 讨论了用于简化训练的 Trainer API,Sylvain Gugger 介绍了关于优化 PyTorch 训练循环的 accelerate
  • 框架集成: Matthew Carrigan 详细介绍了 transformersdatasets 的新 TensorFlow 特性。
  • 协作与部署: Lysandre Debut 介绍了用于项目共享的 Hugging Face Hub,Merve Noyan 演示了使用 Hugging Face Spaces 进行模型演示。
  • 预处理: Lucile Saulnier 提供了关于使用 transformerstokenizers 创建自定义 tokenizer 的指导。
  • 应用开发: Abubakar Abid (Gradio) 讨论了快速构建 ML 应用,Mathieu Desvé 和 Philipp Schmid (AWS/Hugging Face) 介绍了如何提高 ML 的易用性以及通过 Amazon SageMaker 管理训练。

Sources

相关