BLOOM:全球最大開放多語言語言模型

Hugging Face 與 BigScience 計畫已發布 BLOOM,這是一個擁有 1760 億參數的開放存取多語言語言模型。此發布旨在透過提供一個透明訓練的模型,使學術界、非營利組織以及較小的研究實驗室能夠研究與基於此構建,從而實現大型語言模型(LLM)的民主化存取。

模型規模與多語言能力

BLOOM 被設計用以支援廣泛的語言,使其成為首個擁有超過 1000 億參數且能支援其涵蓋的眾多語言的模型。它擁有 1760 億參數,能以 46 種自然語言與 13 種程式語言產生文字,包括西班牙語、法語與阿拉伯語等。

協作開發與訓練

BLOOM 是為期一年、由超過 1,000 位研究人員、遍及 70 多個國家與 250 多個機構共同合作的成果。最終的訓練於 2022 年 3 月 11 日至 7 月 6 日在法國的 Jean Zay 超級電腦上持續 117 天完成。此工作得到法國研究機構 CNRS 與 GENCI 所提供的約 300 萬美元計算資助。

開放存取與負責任 AI 授權

為確保模型可供研究與學習使用,BLOOM 可下載並在本機或雲端服務商上執行。存取受負責任 AI 授權(Responsible AI License,RAIL)管控,該授權於 BigScience 計畫期間制定。

為提升透明度,專案已釋出訓練過程中的中間檢查點與最佳化器狀態。對於沒有高階硬體(例如 8 張 A100 GPU)的使用者,提供由 Google TPU 雲端支援的推論 API 以及模型的 FLAX 版本,以供原型開發與小規模使用。

未來發展路線圖

BLOOM 被視為一系列模型的起點,而非單一獨立的發布。計畫中的改進與發展包括:

  • 使模型具備指令遵循能力,參考 T0++ 的相關工作。
  • 增加對更多語言的支援。
  • 將模型壓縮為更易使用的版本,同時保持效能水平。
  • 以 BLOOM 為基礎構建更複雜的架構。

Sources