大語言模型:新的摩爾定律?
大型語言模型 (LLM) 規模呈指數級增長的趨勢正導致收益遞減、成本高昂以及顯著的環境影響。雖然像 Megatron-Turing NLG 530B 這樣的大型模型展示了工程實力,但邁向兆級參數模型的道路對於現實世界的商業應用而言往往不切實際,且對地球而言是不可持續的。
超大型模型擴展的成本
將模型擴展到數千億個參數會造成極高的財務和環境進入門檻。對「超大型模型」的追求依賴於暴力工程而非演算法效率。
財務上的高昂成本
訓練像 Megatron-Turing NLG 530B 這種規模的模型需要龐大的基礎設施。使用數百台 DGX A100 多 GPU 伺服器——每台成本約為 $199,000——加上網路和託管成本,複製此類實驗的成本可能接近 1 億美元。極少有組織的業務使用場景能證明如此投資的合理性。
環境影響
在 GPU 上訓練深度學習模型是耗能的。單台 DGX 伺服器最高可消耗 6.5 千瓦。這些模型的碳足跡非常可觀;作為參考,2019 年麻省大學的一項研究指出,在 GPU 上訓練 BERT 大約相當於一次橫跨美國的飛行。BERT-Large 僅有 3 億 4000 萬個參數,這意味著 5000 億參數範圍的模型將具有更龐大的碳足跡。
超大型模型的務實替代方案
開發者不應盲目追求模型規模,而應專注於高效、可行的技術來構建高品質的機器學習解決方案。
利用預訓練模型與較小模型
大多數使用場景並不需要自定義模型架構。最高效的工作流程是為特定任務(例如:文本摘要)識別一個預訓練模型,並在目標數據上進行測試。如果準確度不足,則應對模型進行微調 (fine-tuning)。
此外,從業者應選擇滿足其準確度要求的最小模型,以確保更快的預測速度和更低的硬體開銷。效率驅動的研究範例包括:
- SqueezeNet: 與 AlexNet 相比,實現了 50 倍的體積縮減,同時保持或超過其準確度。
- DistilBERT: 保留了 BERT 97% 的語言理解能力,但體積縮小了 40%,速度提升了 60%。
- T0 (Big Science project): 在許多任務上表現優於 GPT-3,同時體積縮小了 16 倍。
微調與從頭開始訓練的對比
在特定數據集上對預訓練模型進行幾輪 (epochs) 的微調,比從頭開始訓練要高效得多。這種遷移學習的方法減少了對大規模數據收集的需求,加速了迭代週期,並降低了生產資源的需求。
基礎設施與優化策略
為了實現效率和可持續性的最大化,組織應利用優化的基礎設施和專業的軟體工具。
雲端基礎設施
雲端基礎設施通常比在地部署 (on-premises) 的方案更具能源和碳效率。AWS、Azure 和 Google Cloud 等供應商提供託管服務(例如 Amazon SageMaker),提供靈活性和按需付費模式,減少了與硬體利用率不足相關的浪費。
模型優化技術
針對規模和速度優化模型涉及幾項複雜的技術策略:
- 專用硬體: 利用 Graphcore、Habana、Google TPU 或 AWS Inferentia 來加速訓練和推理。
- Pruning (剪枝): 移除對預測結果幾乎或完全沒有影響的模型參數。
- Fusion (融合): 合併模型層,例如結合卷積層和激活層。
- Quantization (量化): 將模型參數儲存在較小的值中(例如:使用 8-bit 而非 32-bit)。
像開源的 Optimum 函式庫和 Infinity(一種用於 1 毫秒延遲的容器化解決方案)等工具旨在自動化這些優化過程。
Sources
相關
- Dispatch
- Dispatch
- 專案
- Dispatch
- Dispatch