BLOOM:全球最大开放多语言语言模型

Hugging Face 和 BigScience 项目发布了 BLOOM,这是一款拥有 1760 亿参数的开放获取多语言语言模型。此发布旨在通过提供透明训练的模型,使学术界、非营利组织和小型研究实验室能够研究和基于其进行构建,从而实现对大型语言模型(LLM)的民主化访问。

模型规模与多语言能力

BLOOM 旨在支持广泛的语言,使其成为首个参数超过 1000 亿且能够覆盖众多语言的模型。它拥有 1760 亿参数,能够生成 46 种自然语言和 13 种编程语言的文本,包括西班牙语、法语和阿拉伯语。

协作开发与训练

BLOOM 是为期一年的合作成果,参与者包括来自 70 多个国家和 250 多个机构的超过 1,000 名研究人员。最终的训练在 2022 年 3 月 11 日至 7 月 6 日期间,在法国的 Jean Zay 超级计算机上历时 117 天完成。该工作得到了法国研究机构 CNRS 和 GENCI 约 300 万美元的计算资源资助。

开放获取与负责任 AI 许可

为确保模型可供研究和学习,BLOOM 可下载并在本地机器或云服务商上运行。访问受负责任 AI 许可(RAIL)约束,该许可在 BigScience 项目期间制定。

为进一步提升透明度,项目已发布训练过程中的中间检查点和优化器状态。对于没有高端硬件(如 8 块 A100 GPU)的用户,提供了基于 Google TPU 云的推理 API 以及模型的 FLAX 版本,可用于原型开发和小规模使用。

未来发展路线图

BLOOM 旨在作为一系列模型的起点,而非单独的发布。计划的改进和发展包括:

  • 使模型可指令化,遵循 T0++ 的工作。
  • 增加对更多语言的支持。
  • 将模型压缩为更易用的版本,同时保持性能水平。
  • 以 BLOOM 为基础构建更复杂的架构。

Sources