Hugging Face 課程第二部分與社群活動發佈
Hugging Face 於 2021 年 11 月 15 日發佈了 Hugging Face 課程的第二部分,並同步舉辦了社群活動,以提供技術培訓與實作專案經驗。此次發佈將課程內容從基礎的預訓練模型使用,擴展到廣泛的高階自然語言處理 (NLP) 任務與生態系統工具。
課程第二部分中擴展的 NLP 課程內容
Hugging Face 課程的第二部分將重點從第一部分的入門教材(涵蓋使用預訓練模型、進行文本分類微調以及上傳至 Model Hub)轉向更廣泛的常見 NLP 任務。新內容特別涵蓋:
- Token Classification
- Language Modeling (包含因果與遮罩變體)
- Translation
- Summarization
- Question Answering
此外,課程還對 Hugging Face 生態系統進行了更深入的技術探討,特別強調 datasets 與 tokenizers 函式庫。
社群活動結構與認證
為了支持課程發佈,Hugging Face 舉辦了為期兩天的活動,內容包括技術演講,隨後進行團隊專案實作。參與者被要求在 NLP 任務上微調模型並製作即時演示 (demo)。
參與者的主要激勵措施包括:
- 作品集開發: 製作旨在用於專業 ML 作品集的即時演示。
- 認證: 成功建立演示的參與者將獲得結業證書。
- 運算資源贊助: AWS 透過 Amazon SageMaker 提供免費的運算資源來贊助此次活動。
技術計畫:第一天 - Transformers 與訓練
活動的第一天重點在於 Transformer 模型的高層次概念概述,以及用於訓練或微調它們的方法論。講者陣容包括:
- Thomas Wolf (Hugging Face): 討論了遷移學習與
transformers函式庫的起源。 - Margaret Mitchell: 發表了關於機器學習開發中的價值觀與倫理。
- Jakob Uszkoreit (Inceptive): 探討了當前模型的邊界與潛在失敗情況。
- Jay Alammar (Cohere): 提供 Transformer 架構的視覺化介紹。
- Matthew Watson and Chen Qian (Keras): 涵蓋使用 Keras 的 NLP 工作流程。
- Mark Saroufim (PyTorch): 詳細說明了使用 PyTorch 訓練模型的過程。
技術計畫:第二天 - 生態系統工具
第二天重點在於 Hugging Face、Gradio 與 AWS 工具的實際應用。會議涵蓋以下技術領域:
- 訓練優化: Lewis Tunstall 討論了用於簡化訓練的
TrainerAPI,而 Sylvain Gugger 則介紹了用於優化 PyTorch 訓練迴圈的accelerate。 - 框架整合: Matthew Carrigan 詳細說明了
transformers與datasets的新 TensorFlow 功能。 - 協作與部署: Lysandre Debut 介紹了用於專案分享的 Hugging Face Hub,而 Merve Noyan 則演示了使用 Hugging Face Spaces 進行模型演示。
- 預處理: Lucile Saulnier 提供了關於使用
transformers與tokenizers建立自定義分詞器 (tokenizers) 的指導。 - 應用程式開發: Abubakar Abid (Gradio) 討論了快速構建 ML 應用程式,而 Mathieu Desvé 與 Philipp Schmid (AWS/Hugging Face) 則介紹了如何讓 ML 變得易於使用,以及如何透過 Amazon SageMaker 管理訓練。
Sources
- OriginalCourse Launch Community Event
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch