allenai/dolma

Data and tools for generating and inspecting OLMo pre-training data.

解决的问题

Dolma 提供了一种高性能的方法,用于为机器学习模型的预训练构建大规模数据集。它解决了从网页内容、学术论文、代码等多种来源处理和清理数十亿文档的挑战,以创建高质量的训练语料库。

工作原理

该项目由两部分组成:一个规模庞大的 3 万亿 token 开放数据集和一个工具包。该工具包利用内置的并行处理能力,可在单机、集群或云环境中并发处理文档。它包含基于流行数据筛选方法(如 Gopher 和 C4)的预构建标记器,并使用基于 Rust 的 Bloom 过滤器实现快速文档去重。

适用人群

需要工具来对海量原始数据进行筛选、清理和去重以用于预训练的大规模语言模型研究人员和开发者。

主要亮点

  • 大规模开放数据集:可访问包含多样化网络、学术和代码数据的 3 万亿 token 数据。
  • 高性能:能够并发处理数十亿文档。
  • 云原生:支持 AWS S3 兼容存储,并可在各种计算环境中运行。
  • 开箱即用的标记器:包含可立即使用的标准数据筛选标记器。
  • 快速去重:使用 Rust 实现高速文档重复项删除。

相关

  • 项目
  • 项目
  • 项目
  • 项目