Hugging Face: 机器学习即代码时代
Hugging Face 提议向“机器学习即代码”转型,认为 AI 部署的成熟度要求采用成熟的软件工程和 DevOps 实践,以构建稳健、可扩展且可重复的系统。
为 ML 采用软件工程的严谨性
机器学习工作流必须从实验性的沙盒环境过渡到生产级的软件工程。Hugging Face 断言,拥有数十年历史的软件工程最佳实践——包括版本控制、可重用性、可测试性、自动化、部署、监控、性能和优化——直接适用于数据科学和机器学习。
这种方法得到了 Google 的“机器学习规则”的支持,该规则建议从业者应该“像你所是的伟大工程师那样进行机器学习,而不是像你所不是的伟大机器学习专家那样进行机器学习”。其目标是超越概念验证和 A/B 测试,因为“一个还不错的生产模型每次都能击败一个伟大的沙盒模型”。
MLOps 的兴起与基础设施抽象化
由于云 API、基础设施即代码以及像 Kubeflow 这样的平台的兴起,基础设施不再是 ML 部署的主要障碍。根据 Hugging Face 引用的 Kaggle 调查,75% 的受访者使用云服务,超过 45% 使用企业级 ML 平台,其中 Amazon SageMaker、Databricks 和 Azure ML Studio 最为突出。
由于基础设施正日益趋向于软件定义,Hugging Face 建议组织应优先聘请精通 ML 的软件和 DevOps 工程师,而不是增加更多的数据科学家,以确保模型能从沙盒高效地迁移到生产环境。
Transformer 作为通用型 ML 架构
Transformer 架构已演变成一种通用框架,其应用范围已从自然语言处理 (NLP) 扩展到其他领域:
- Computer Vision: 模型如 Vision Transformer (ViT) 和 CoAtNet(结合了 transformers 和 convolutions)在 ImageNet 上的图像分类任务中树立了新的基准,同时降低了训练计算需求。
- Audio and 3D Modeling: Transformers 被有效地用于语音识别以及用于建模 3D 环境的点云(例如在自动驾驶场景中发现的那些)。
Kaggle 调查数据表明,虽然 RNNs、CNNs 和 Gradient Boosting 算法的使用正在减少,但 Transformers 的采用率正在持续增长。这种转变使得“迁移学习”工作流成为可能,团队可以选择经过验证的现成模型并针对特定数据进行微调,从而显著降低训练时间和计算成本。
Hugging Face 生态系统
为了促进向“ML 即代码”的转型,Hugging Face 提供了一个包含超过 16,000 个模型和 1,600 个数据集的中心化枢纽。该生态系统包括以下工具:
- Inference: 用于部署模型的 API。
- AutoNLP: 自动化机器学习工具。
- Latency Optimization: 像 Infinity 这样的工具。
- Hardware Acceleration: 与专用硬件的集成。
通过提供这些资源,Hugging Face 旨在通过最大限度地减少训练、优化和部署模型所需的代码量,同时将软件工程最佳实践嵌入到 ML 生命周期中,从而提高机器学习的生产力。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch