Hugging Face: 機器學習即程式碼的時代
Hugging Face 提倡轉向「機器學習即程式碼」(Machine Learning as Code),認為 AI 部署的成熟度需要採用成熟的軟體工程與 DevOps 實踐,以建立穩健、可擴展且可重複的系統。
為 ML 採用軟體工程的嚴謹性
機器學習工作流程必須從實驗性的沙盒轉向生產級的軟體工程。Hugging Face 主張,長達十年的軟體工程最佳實踐——包括版本控制、可重用性、可測試性、自動化、部署、監控、效能與優化——皆可直接應用於數據科學與機器學習。
這種方法得到了 Google 的「機器學習規則」(Rules of Machine Learning)的支持,該規則建議從業者應該「像你所是的偉大工程師那樣進行機器學習,而不是像你並非的偉大機器學習專家那樣」。其目標是超越概念驗證與 A/B 測試,因為「一個還不錯的生產模型每次都能勝過一個很棒的沙盒模型」。
MLOps 與基礎設施抽象化的興起
由於雲端 API、基礎設施即程式碼(Infrastructure as Code)以及像 Kubeflow 這樣的平台的興起,基礎設施不再是 ML 部署的主要障礙。根據 Hugging Face 引用的 Kaggle 調查,75% 的受訪者使用雲端服務,超過 45% 使用企業級 ML 平台,其中 Amazon SageMaker、Databricks 與 Azure ML Studio 最為顯著。
由於基礎設施日益趨向軟體定義,Hugging Face 建議組織應優先聘僱精通 ML 的軟體與 DevOps 工程師,而非增加更多數據科學家,以確保模型能從沙盒高效地轉移到生產環境。
Transformer 作為通用型 ML 架構
Transformer 架構已演進為一種通用框架,其應用範圍已超越自然語言處理(NLP)並擴展至其他領域:
- 電腦視覺: 如 Vision Transformer (ViT) 與 CoAtNet(結合了 transformers 與 convolutions)等模型,在 ImageNet 的圖像分類任務中樹立了新基準,同時降低了訓練所需的運算量。
- 音訊與 3D 建模: Transformers 被有效地用於語音辨識以及用於建模 3D 環境(例如自動駕駛場景中常見的點雲)的點雲處理。
Kaggle 調查數據顯示,雖然 RNNs、CNNs 與 Gradient Boosting 演算法的使用率正在下降,但 Transformers 的採用率持續增長。這種轉變實現了「遷移學習」(transfer learning)工作流程,讓團隊可以選擇經過驗證的現成模型並在特定數據上進行微調,從而顯著降低訓練時間與運算成本。
Hugging Face 生態系統
為了促進向「ML 即程式碼」的轉型,Hugging Face 提供了一個包含超過 16,000 個模型與 1,600 個數據集的集中式中心。該生態系統包括用於以下方面的工具:
- 推論 (Inference): 用於部署模型的 API。
- AutoNLP: 自動化機器學習工具。
- 延遲優化 (Latency Optimization): 如 Infinity 等工具。
- 硬體加速 (Hardware Acceleration): 與專用硬體的整合。
透過提供這些資源,Hugging Face 旨在透過減少訓練、優化與部署模型所需的程式碼量,同時將軟體工程最佳實踐嵌入到 ML 生命週期中,使機器學習變得更具生產力。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch