Hugging Face 課程第二部分與社群活動發佈

Hugging Face 於 2021 年 11 月 15 日發佈了 Hugging Face 課程的第二部分,並同步舉辦了社群活動,以提供技術培訓與實作專案經驗。此次發佈將課程內容從基礎的預訓練模型使用,擴展到廣泛的高階自然語言處理 (NLP) 任務與生態系統工具。

課程第二部分中擴展的 NLP 課程內容

Hugging Face 課程的第二部分將重點從第一部分的入門教材(涵蓋使用預訓練模型、進行文本分類微調以及上傳至 Model Hub)轉向更廣泛的常見 NLP 任務。新內容特別涵蓋:

  • Token Classification
  • Language Modeling (包含因果與遮罩變體)
  • Translation
  • Summarization
  • Question Answering

此外,課程還對 Hugging Face 生態系統進行了更深入的技術探討,特別強調 datasetstokenizers 函式庫。

社群活動結構與認證

為了支持課程發佈,Hugging Face 舉辦了為期兩天的活動,內容包括技術演講,隨後進行團隊專案實作。參與者被要求在 NLP 任務上微調模型並製作即時演示 (demo)。

參與者的主要激勵措施包括:

  • 作品集開發: 製作旨在用於專業 ML 作品集的即時演示。
  • 認證: 成功建立演示的參與者將獲得結業證書。
  • 運算資源贊助: AWS 透過 Amazon SageMaker 提供免費的運算資源來贊助此次活動。

技術計畫:第一天 - Transformers 與訓練

活動的第一天重點在於 Transformer 模型的高層次概念概述,以及用於訓練或微調它們的方法論。講者陣容包括:

  • Thomas Wolf (Hugging Face): 討論了遷移學習與 transformers 函式庫的起源。
  • Margaret Mitchell: 發表了關於機器學習開發中的價值觀與倫理。
  • Jakob Uszkoreit (Inceptive): 探討了當前模型的邊界與潛在失敗情況。
  • Jay Alammar (Cohere): 提供 Transformer 架構的視覺化介紹。
  • Matthew Watson and Chen Qian (Keras): 涵蓋使用 Keras 的 NLP 工作流程。
  • Mark Saroufim (PyTorch): 詳細說明了使用 PyTorch 訓練模型的過程。

技術計畫:第二天 - 生態系統工具

第二天重點在於 Hugging Face、Gradio 與 AWS 工具的實際應用。會議涵蓋以下技術領域:

  • 訓練優化: Lewis Tunstall 討論了用於簡化訓練的 Trainer API,而 Sylvain Gugger 則介紹了用於優化 PyTorch 訓練迴圈的 accelerate
  • 框架整合: Matthew Carrigan 詳細說明了 transformersdatasets 的新 TensorFlow 功能。
  • 協作與部署: Lysandre Debut 介紹了用於專案分享的 Hugging Face Hub,而 Merve Noyan 則演示了使用 Hugging Face Spaces 進行模型演示。
  • 預處理: Lucile Saulnier 提供了關於使用 transformerstokenizers 建立自定義分詞器 (tokenizers) 的指導。
  • 應用程式開發: Abubakar Abid (Gradio) 討論了快速構建 ML 應用程式,而 Mathieu Desvé 與 Philipp Schmid (AWS/Hugging Face) 則介紹了如何讓 ML 變得易於使用,以及如何透過 Amazon SageMaker 管理訓練。

Sources

相關