大语言模型:一个新的摩尔定律?
大语言模型 (LLM) 规模呈指数级增长的趋势正导致收益递减、成本高昂以及显著的环境影响。虽然像 Megatron-Turing NLG 530B 这样的大规模模型展示了工程实力,但迈向万亿参数模型的道路对于现实世界的商业应用往往是不切实际的,对地球也是不可持续的。
超大规模模型扩展的成本
将模型扩展到数千亿参数会造成极高的财务和环境准入门槛。对“超大规模模型”的追求依赖于暴力工程而非算法效率。
财务上的高昂成本
训练像 Megatron-Turing NLG 530B 这种规模的模型需要庞大的基础设施。使用数百台 DGX A100 多 GPU 服务器(每台成本约为 $199,000)以及网络和托管成本,复制此类实验的成本可能接近 1 亿美元。极少有组织拥有能够证明如此投资合理性的业务用例。
环境影响
在 GPU 上训练深度学习模型是高能耗的。单台 DGX 服务器的功耗可达 6.5 千瓦。这些模型的碳足迹非常巨大;作为参考,马萨诸塞大学 2019 年的一项研究指出,在 GPU 上训练 BERT 大约相当于一次横跨美国的飞行。BERT-Large 仅有 3.4 亿参数,这暗示了 5000 亿参数规模的模型将拥有更加庞大的碳足迹。
超大规模模型的务实替代方案
开发者不应盲目追求模型规模,而应专注于高效、可操作的技术,以构建高质量的机器学习解决方案。
利用预训练和较小的模型
大多数用例并不需要定制的模型架构。最高效的工作流程是为特定任务(例如文本摘要)识别一个预训练模型并在目标数据上进行测试。如果准确率不足,则应对模型进行微调。
此外,从业者应选择满足其准确率要求的最小模型,以确保更快的预测速度和更低的硬件开销。效率驱动的研究示例包括:
- SqueezeNet: 与 AlexNet 相比,实现了 50 倍的体积缩减,同时保持或超过了其准确率。
- DistilBERT: 保留了 BERT 97% 的语言理解能力,同时体积缩小了 40%,速度提升了 60%。
- T0 (Big Science project): 在许多任务上优于 GPT-3,同时体积缩小了 16 倍。
微调 vs. 从头开始训练
在特定数据集上对预训练模型进行几个 epoch 的微调,比从头开始训练要高效得多。这种迁移学习的方法减少了对大规模数据收集的需求,加速了迭代周期,并降低了生产环境的资源需求。
基础设施与优化策略
为了实现效率和可持续性的最大化,组织应利用优化的基础设施和专门的软件工具。
云端基础设施
云端基础设施通常比本地替代方案更具能源和碳效率。AWS、Azure 和 Google Cloud 等提供商提供托管服务(例如 Amazon SageMaker)来提供灵活性和按需付费模式,从而减少了与硬件利用不足相关的浪费。
模型优化技术
针对大小和速度优化模型涉及几种复杂的策略:
- 专用硬件: 利用 Graphcore、Habana、Google TPU 或 AWS Inferentia 来加速训练和推理。
- Pruning (剪枝): 移除对预测结果几乎没有或完全没有影响的模型参数。
- Fusion (融合): 合并模型层,例如将卷积层和激活层结合起来。
- Quantization (量化): 将模型参数存储为较小的值(例如,使用 8-bit 而不是 32-bit)。
像开源的 Optimum 库和 Infinity(一种针对 1 毫秒延迟的容器化解决方案)这类工具旨在自动化这些优化过程。
Sources
相关
- Dispatch
- Dispatch
- 项目
- Dispatch
- Dispatch