LeMaterial v1.0: LeMat-Bulk 数据集发布

LeMaterial v1.0 作为一项开源倡议正式发布,推出了 LeMat-Bulk 数据集。该数据集将来自 Materials Project、Alexandria 和 OQMD 的 670 万条条目统一到一种具有七种属性的标准格式中,旨在加速材料发现。

为什么选择 LeMaterial?

LeMaterial 通过将 Materials Project、Alexandria 和 OQMD 的数据统一并标准化为具有一致且系统属性的高质量资源,解决了主要材料数据集碎片化的问题。

材料科学领域处于量子化学与机器学习的交汇点,充满了机遇——从更亮的 LED、电化学电池、更高效的光伏电池到可回收塑料,应用是无穷无尽的。通过在大型结构化数据集上利用机器学习,研究人员可以以前所未有的规模对新材料进行高通量筛选和测试,从而显著加速具有所需特性的新型化合物的发现周期。在这种范式下,数据成为了驱动机器学习模型的关键燃料,这些模型可以指导实验、降低成本,并比以往任何时候都更快地实现突破。

这一领域由非常完整的数据库提供支持,例如 Materials Project、Alexandria 和 OQMD,它们都是开源的,并遵循 CC-BY-4.0 许可。然而,这些数据集在格式、参数和范围上各不相同,带来了以下挑战:

  • 数据集集成问题(例如:格式或字段定义不一致、计算方法不兼容)
  • 数据集组成中的偏差(例如:Materials Project 侧重于氧化物和电池材料)
  • 范围有限(例如:NOMAD 侧重于量子化学计算而非材料属性)
  • 不同数据库之间相似材料缺乏清晰的联系或标识符

这种碎片化的现状使得 AI4Science 和材料信息学领域的研究人员难以有效地利用现有数据。无论是涉及训练基础机器学习模型、构建准确的相图、识别新材料,还是有效地探索化学空间,目前都没有简单的解决方案。虽然像 Optimade 这样的努力实现了结构数据的标准化,但它们并未解决材料属性的差异或数据集范围的偏差问题。

LeMaterial 通过将来自三个主要数据库(Materials Project、Alexandria 和 OQMD)的数据统一并标准化为一个具有一致且系统属性的高质量资源,解决了这些挑战。

实现清洁、统一且标准化的数据集

LeMat-Bulk v1.0 提供了一个经过清洗、合并和标准化的数据集,包含 670 万条条目和七种材料属性,使用了 Optimade 格式、基于哈希的材料指纹以及可视化工具。

LeMat-Bulk 不仅仅是一个具有宽松许可(CC-BY-4.0)的大规模合并数据集。凭借其具有一致属性的 670 万条条目,它代表了创建用于材料科学的精选且标准化开源生态系统的基础性步骤,旨在简化研究工作流程并提高数据质量。

版本 描述与价值 日期
v.1.0 * 从各种来源收集和合并数据:Materials Project、Alexandria 和 OQMD 数据集,包括多个字段和 DFT 泛函 (PBE, PBESol, SCAN)。 * 数据清洗:识别并移除不符合设定标准的 datapoints(例如具有不兼容计算的数据点)。 * 标准化:使用 Optimade 标准统一跨数据库的字段集格式。 * 材料指纹:使用经过良好基准测试的哈希函数为每种材料分配唯一的标识符,从而实现去重。 * 可访问性与可视化:得益于基于 Materials Project 开发的 Crystal Toolkit、Pymatgen 和 Dash 组件的开源工具,所提出的新数据集可以实现可视化(相图、材料探索器) 2024年12月10日
v.1.1 * 新数据:为 Materials Project 数据库中的许多材料计算电荷数据(新增 5.3 万个数据点、带隙信息、统一的能量校正方案) * 评估:代码哈希函数基准测试 * 新功能:材料相似性度量和相似结构检索工具 * 新模型:在数据上训练的 Equiformerv2 和 FAENet * 数据验证:检查字段、格式等的兼容性 2025年第一季度
未来版本 * 新数据:发布来自 Materials Project 的 r2SCAN 数据 * 新表面数据集:OC20 & OC22 数据集,并具备覆盖 bulk 以外模型的能力(表面、slab+ads 和分子结构) * 进一步协调:在类似格式中包含来自 MPTrj、OMat24 的轨迹,在我们的数据库中包含关系数据 2025年第二季度

我们提供不同的数据集和子集,根据研究人员的需求(一致的计算、去重材料或全面探索)提供定制化的工作流程:

  • 兼容性 (Compatibility):这些子集仅提供可以混合计算的数据。目前提供 3 种泛函(PBE, PBESol 和 SCAN)。
  • 不兼容 (Non-compatible):此子集提供不包含在兼容性子集中的所有材料。
  • LeMat-BulkUnique:此数据集拆分使用我们的结构指纹算法提供去重后的材料。它有 3 个子集,分别对应 PBE、PBESol 和 SCAN 泛函。

集成经过良好基准测试的材料指纹

LeMaterial 引入了一种基于哈希的材料指纹,能够实现快速的新颖性检测、重复项删除和跨数据集链接。

除了构建这个标准化数据集外,LeMaterial 的主要贡献之一是提出了一种通过哈希函数定义材料指纹的方法,该方法为每种材料分配一个唯一的标识符。

目前识别材料相对于数据库是否具有新颖性的方法主要依赖于相似性度量,这需要通过组合尝试来筛选现有数据库以寻找新颖性。为了在数据集中提供更快的创新检测,Entalpic 引入了一种哈希方法来计算材料的指纹。

以上是指纹生成的分解。我们在晶体结构上使用键合算法(例如 EconNN)来提取图,然后在该图上计算 Weisfeiler-Lehman 算法以获得哈希值。该哈希值与成分和空间群信息相结合,从而创建材料指纹。

我们的指纹方法具有以下优势:

  • 快速识别材料是新颖的还是已被编目的。
  • 确保数据集没有重复和不一致之处。
  • 允许连接不同数据集之间的材料。
  • 支持对热力学性质(如能量高于凸包 energy above the hull)进行更高效的计算。

下面是我们的哈希函数与 Pymatgen 的 StructureMatcher 在查找数据集所有重复项时的对比。该实验是在两个具有完全不同结构的数据集上运行的。

数据集 结构数量 哈希函数任务时间(12 个 CPU 并行) StructureMatcher 任务时间(64 个 CPU 并行)
Carbon-24 10,153 100 秒 17 小时
MPTS-52 40,476 330 秒 4.9 小时

此外,我们计划发布一套精心策划的基准测试,以评估我们哈希函数的有效性。例如,我们研究了:

  • 基于现有数据库中材料识别标签的不同材料是否会导致不同的哈希值
  • 对材料添加微小噪声或应用对称操作是否会导致相同的哈希值
  • 跨数据库或数据库内部具有相同哈希值的材料是否确实是同一种材料 —— 通过人工和 DFT 检查
  • 与 Pymatgen 的 StructureMatcher 在现有数据库上的表现相比,我们的哈希速度和准确度如何

**🤗 向社区发出呼吁:**我们的目标不是将这种指纹方法定位为去重材料数据库和寻找新材料的唯一解决方案,而是促进围绕这一问题的讨论。该哈希技术目前的一个局限性是它不涵盖无序结构;我们希望推动社区达成共识,同时在此期间提出一种相对简单且高效的指纹方法。

LeMaterial 的实践:应用与影响

LeMaterial 支持扩展的相图探索、跨数据库属性比较、快速新颖性检测以及机器学习原子间势能的训练。

从长远来看,LeMaterial 旨在成为一个由社区驱动的倡议,汇集大型且精选的数据集、机器学习模型、便捷的工具包等。它的设计目标是实用且灵活的,能够支持广泛的应用,例如:

  • 探索扩展相图(链接到我们的相图探索器,得益于 Materials Project 的各种开源工具构建),使用更广泛的数据集构建,以更详细地分析化学空间。结合更大的数据集意味着我们可以为给定成分空间中的材料稳定性提供更精细的分辨率。

  • 跨数据库和泛函比较材料属性:通过为研究人员提供跨 DFT 泛函的数据,并通过我们的材料指纹算法链接材料,我们能够建立并连接通过不同参数计算的材料属性。这让研究人员能够洞察泛函在不同成分空间中可能表现出的行为和差异。

  • 确定材料是否具有新颖性。我们的哈希函数允许研究人员快速评估材料是唯一的还是重复的,从而简化发现过程并避免冗余计算。

    • 示例 1:我们的指纹方法将以下 Alexandria 条目(agm002153972, agm002153975)识别为可能是同一种材料 —— 具有相同的哈希值。当我们对能量较高的条目进行弛豫时,材料弛豫到了能量较低的构型。

    • 示例 2:将我们的哈希应用于另一个经常用于训练生成模型的数据库(AIRSS),我们发现了以下具有相同哈希值的材料。

      这里需要特别指出,Pymatgen 的 StructureMatcher 将这两个单胞识别为不同的材料,而它们实际上是完全相同的结构。在这里,我们的哈希算法能够识别出它们确实是相同的。

  • 训练预测性机器学习模型。我们还可以在 LeMat-Bulk 上训练机器学习原子间势能,如 EquiformerV2。这些模型将受益于其规模、数据质量以及在成分空间中消除偏差的特性,评估这一新数据集带来的益处将是非常有趣的。关于如何将 LeMaterial 与 Fairchem 结合的一个示例可以在 Colab 中找到。我们目前正在使用该数据集训练 EquiformerV2 模型 —— 敬请期待 💫

核心要点

LeMaterial 提供了一种解决方案,它统一、标准化、并对现有主要数据源进行了额外的清洗和验证,从而加速研究,提高机器学习模型质量,并使材料发现更加高效且易于获取。

作为一个社区,我们通常非常重视这些大规模开源数据库的质量。然而,缺乏标准化使得利用多个数据集成为一个巨大的挑战。LeMaterial 提供了一种解决方案,它对现有主要数据源进行了统一、标准化、额外的清洗和验证工作。这个新的开放科学项目旨在加速研究,提高机器学习模型的质量,并使材料发现更加高效且易于获取。

我们才刚刚开始 —— 我们知道仍存在缺陷和需要改进的地方 —— 因此我们非常希望听到您的反馈!如果您有兴趣为这一开源倡议做出贡献,请联系我们。我们非常期待与社区一起,通过新的数据集、工具和应用来继续扩展 LeMaterial! ⚛️🤗

引用

下载 LeMaterial 的内容即表示您同意接受知识共享署名 4.0 (CC-BY-4.0) 许可,这意味着在给予 LeMaterial 正确署名的前提下,内容可以被复制、分发、传输和改编,而无需获得 LeMaterial 的特定许可。

如果您在研究中将 LeMaterial 作为资源使用,请引用我们数据卡片中的引用部分(论文即将发布)。

CC-BY-4.0(Materials Project、Alexandria、OQMD 使用的许可)要求妥善致谢。因此,如果您使用的材料数据在 immutable_id 中包含 ("mp-"),请引用 Materials Project。如果您使用的材料数据在 immutable_id 中包含 ("agm-"),请引用 Alexandria、PBE 或 Alexandria PBESol、SCAN。如果您使用的材料数据在 immutable_id 中包含 ("oqmd-"),请引用 OQMD。最后,如果您出于可视化目的使用相图,或使用 Materials Explorer 中的晶体查看器,请致谢 Crystal Toolkit。


了解更多关于 LeMaterial 的信息并参与其中:

  • 加入社区的表单
  • Hugging Face Space
  • Github

Sources