LeMaterial v1.0: LeMat-Bulk 資料集發佈
LeMaterial v1.0 作為一項開源倡議正式啟動,發佈了 LeMat-Bulk 資料集。該資料集將來自 Materials Project、Alexandria 和 OQMD 的 670 萬條目統一成具有七種屬性的標準格式,旨在加速材料研發。
為什麼需要 LeMaterial?
LeMaterial 解決了主要材料資料集碎片化的問題,透過將 Materials Project、Alexandria 和 OQMD 的數據統一並標準化為具有一致且系統性屬性的高品質資源。
材料科學領域處於量子化學與機器學習的交匯點,充滿了機會——從更亮的 LED、電化學電池、更高效的太陽能電池到可回收塑料,應用範圍無窮無盡。透過在大型結構化資料集上利用機器學習,研究人員可以進行前所未有的規模的高通量篩選與測試,顯著加速具有所需特性之新化合物的發現週期。在這種模式下,數據成為驅動機器學習模型的關鍵燃料,能夠引導實驗、降低成本,並比以往更快地實現突破。
這個領域由非常完整的資料集所驅動,例如 Materials Project、Alexandria 和 OQMD,這些資料集皆為開源並採用 CC-BY-4.0 授權。然而,這些資料集在格式、參數和範圍上各不相同,帶來了以下挑戰:
- 資料集整合問題(例如:格式或欄位定義不一致、計算方式不相容)
- 資料集組成中的偏差(例如:Materials Project 側重於氧化物和電池材料)
- 範圍有限(例如:NOMAD 側重於量子化學計算而非材料特性)
- 不同資料庫之間相似材料缺乏明確的關聯或識別碼
這種碎片化的現狀使得 AI4Science 和材料資訊學領域的研究人員難以有效利用現有數據。無論應用是訓練基礎機器學習模型、構建準確的相圖、識別新材料,還是有效地探索化學空間,目前都沒有簡單的解決方案。雖然像 Optimade 這樣的努力實現了結構數據的標準化,但它們並未解決材料特性或資料集範圍偏差的問題。
LeMaterial 透過將三個主要資料庫——Materials Project、Alexandria 和 OQMD——的數據統一並標準化為具有一致且系統性屬性的高品質資源,來應對這些挑戰。
實現乾淨、統一且標準化的資料集
LeMat-Bulk v1.0 提供了一個經過清洗、合併且標準化的資料集,包含 670 萬條目和七種材料屬性,並使用 Optimade 格式、基於雜湊(hashing)的材料指紋以及視覺化工具。
LeMat-Bulk 不僅僅是一個具有寬鬆授權(CC-BY-4.0)的大型合併資料集。憑藉其具有一致屬性的 670 萬條目,它代表了為材料科學建立策劃且標準化之開放生態系統的基礎步驟,旨在簡化研究工作流程並提高數據品質。
| 發佈版本 | 描述與價值 | 日期 |
|---|---|---|
| v.1.0 | * 從各種來源收集與合併數據:Materials Project、Alexandria 和 OQMD 資料集,包括多個欄位和 DFT 泛函 (PBE, PBESol, SCAN)。 * 數據清洗:識別並移除不符合設定標準的數據點(例如:具有不相容計算的數據)。 * 標準化:使用 Optimade 標準統一各資料庫的欄位格式。 * 材料指紋:使用經過良好基準測試的雜湊函數為每種材料分配唯一的識別碼,從而能夠去除重複項。 * 可訪問性與視覺化:得益於基於 Materials Project 開發的 Crystal Toolkit、Pymatgen 和 Dash 組件的開源工具,所提出的新資料集可以進行視覺化(相圖、材料瀏覽器) | 2024 年 12 月 10 日 |
| v.1.1 | * 新數據:為 Materials Project 資料庫中的許多材料計算電荷數據(新增 5.3 萬個數據點、能隙資訊、統一的能量修正方案) * 評估:代碼雜湊函數基準測試 * 新功能:材料相似性指標與相似結構檢索工具 * 新模型:在數據上訓練的 Equiformerv2 和 FAENet * 數據驗證:檢查欄位、格式等的相容性 | 2025 年 Q1 |
| 未來版本 | * 新數據:發佈來自 Materials Project 的 r2SCAN 數據 * 新表面資料集:OC20 & OC22 資料集,並具備涵蓋塊體(bulk)以外模型的能力(表面、板層+吸附質及分子結構) * 進一步協調:在類似格式中包含來自 MPTrj、OMat24 的軌跡,在我們的資料庫中包含關聯數據 | 2025 年 Q2 |
我們提供不同的資料集和子集,根據研究人員的需求(一致的計算、去重材料或全面探索)提供量身定制的工作流程:
- 相容性(Compatibility):這些子集僅提供可以混合使用的計算。目前提供 3 種泛函(PBE, PBESol 和 SCAN)。
- 不相容(Non-compatible):此子集提供所有未包含在相容性子集中的材料。
- LeMat-BulkUnique:此資料集分割使用我們的結構指紋算法提供去重後的材料。它提供 3 個子集,分別針對 PBE、PBESol 和 SCAN 泛函。
整合經過良好基準測試的材料指紋
LeMaterial 引入了一種基於雜湊的材料指紋,能夠實現快速的新穎性檢測、重複項移除和跨資料集連結。
除了構建這個標準化資料集外,LeMaterial 的關鍵貢獻之一是透過雜湊函數提出材料指紋的定義,為每種材料分配一個唯一的識別碼。
目前識別材料相對於資料庫是否具有新穎性的方法,主要依賴於相似性指標,這需要透過組合式嘗試來篩選現有資料庫以尋找新穎性。為了在資料集中提供更快的檢測,Entalpic 引入了一種雜湊方法來計算材料的指紋。
以上是指紋生成的細節。我們在晶體結構上使用結合算法(例如 EconNN)來提取圖(graph),然後在圖上計算 Weisfeiler-Lehman 算法來獲得雜湊值。這個雜湊值與組成和空間群資訊結合,從而創建材料指紋。
我們的指紋方法具有多項優點:
- 快速識別材料是新穎的還是已被編錄的。
- 確保資料集沒有重複和不一致之處。
- 允許連接不同資料集之間的材料。
- 支持對熱力學性質(如能量高於凸包能量 energy above the hull)進行更高效的計算。
以下是我們的雜湊函數與 Pymatgen 的 StructureMatcher 在尋找資料集所有重複項時的對比。該實驗是在兩個具有非常不同結構的資料集上運行的。
| 資料集 | 結構數量 | 雜湊函數任務時間(12 個 CPU 並行) | StructureMatcher 任務時間(64 個 CPU 並行) |
|---|---|---|---|
| Carbon-24 | 10,153 | 100 秒 | 17 小時 |
| MPTS-52 | 40,476 | 330 秒 | 4.9 小時 |
此外,我們計劃發佈一套精心策劃的基準測試,以評估我們雜湊函數的有效性。例如,我們研究了:
- 基於現有資料庫中的材料識別標籤,不同的材料是否會導致不同的雜湊值
- 對材料添加微小噪聲或應用對稱操作是否會導致相同的雜湊值
- 在資料庫內或資料庫之間共享相同雜湊值的材料,是否確實是同一種材料——透過人工和 DFT 檢查
- 與 Pymatgen 的 StructureMatcher 在現有資料庫上的表現相比,我們的雜湊速度和準確度如何
**🤗 向社群發出呼籲:**我們的目標並不是將這種指紋方法定位為去重材料資料集和尋找新材料的唯一解決方案,而是促進圍繞這個問題的討論。目前這種雜湊技術的一個局限是它不涵蓋無序結構;我們希望推動社群尋求共識,同時在此期間提出一種相對簡單且高效的指紋方法。
LeMaterial 實踐:應用與影響
LeMaterial 實現了擴展的相圖探索、跨資料集屬性比較、快速新穎性檢測以及機器學習原子間勢能的訓練。
從長期來看,LeMaterial 的目標是成為一個由社群驅動的倡議,匯集大型且經過策劃的資料集、機器學習模型、實用的工具包等。它的設計旨在具備實用性和靈活性,能夠支持廣泛的應用,例如:
探索擴展相圖(連結至我們的相圖瀏覽器,感謝 Materials Project 提供的各種開源工具構建),使用更廣泛的資料集構建,以更詳細地分析化學空間。結合更大的資料集意味著我們可以在給定的組成空間中提供更精細的材料穩定性解析度。
跨資料集和泛函比較材料屬性:透過為研究人員提供跨 DFT 泛函的數據,並透過我們的材料指紋算法連結材料,我們能夠建立並連接透過不同參數計算的材料屬性。這讓研究人員能夠深入了解泛函在組成空間中可能表現出的行為與差異。
判定材料是否具有新穎性。我們的雜湊函數允許研究人員快速評估材料是獨特的還是重複的,從而簡化發現過程並避免冗餘計算。
範例 1:我們的指紋方法識別出以下 Alexandria 條目 (
agm002153972,agm002153975) 可能 是同一種材料——因為具有相同的雜湊值。當我們對能量較高的條目進行弛豫時,該材料弛豫到了能量較低的構型。範例 2:將我們的雜湊應用於另一個常用於訓練生成模型的資料集 (AIRSS),我們發現了以下具有相同雜湊值的材料。
這裡需要注意的是,Pymatgen 的 StructureMatcher 將這兩個單元晶胞識別為不同的材料,而它們實際上是完全相同的結構。在這裡,我們的雜湊算法能夠將它們識別為確實相同的材料。
訓練預測型機器學習模型。我們還可以在
LeMat-Bulk上訓練機器學習原子間勢能模型,如 EquiformerV2。這些模型應能從其規模、數據品質以及消除組成空間偏差中受益,評估這一新資料集的益處將非常有趣。關於如何將 LeMaterial 與 Fairchem 結合的一個範例可以在 Colab 中找到。我們目前正在使用該資料集訓練 EquiformerV2 模型——敬請期待 💫
重點總結
LeMaterial 提供了一種解決方案,對現有的主要數據源進行統一、標準化、額外清洗與驗證,從而加速研究、提高機器學習模型品質,並使材料發現更加高效且易於獲取。
作為一個社群,我們通常非常重視這些大規模開源資料集的品質。然而,缺乏標準化使得利用多個資料集成為一項巨大的挑戰。LeMaterial 提供了一種解決方案,對現有的主要數據源進行統一、標準化、額外清洗與驗證。這個新的開放科學項目旨在加速研究、提高機器學習模型的品質,並使材料發現更加高效且易於獲取。
我們才剛剛開始——我們知道仍有缺陷與改進空間——因此非常希望聽到您的回饋!如果您有興趣為這項開源倡議做出貢獻,請與我們聯繫。我們非常期待與社群一起,透過新的資料集、工具和應用來持續擴展 LeMaterial! ⚛️🤗
引用
下載 LeMaterial 的內容即表示您同意接受 Creative Commons Attribution 4.0 授權,這意味著在給予 LeMaterial 適當歸屬的前提下,內容可以被複製、分發、傳輸和改編,而無需獲得 LeMaterial 的特定許可。
如果您在研究中使用 LeMaterial 作為資源,請引用我們數據卡(論文即將發佈)中的引用部分。
CC-BY-4.0(Materials Project、Alexandria、OQMD 使用的授權)要求適當的致謝。因此,如果您使用的材料數據在 immutable_id 中包含 ("mp-"),請引用 Materials Project。如果您使用的材料數據在 immutable_id 中包含 ("agm-"),請引用 Alexandria、PBE 或 Alexandria PBESol、SCAN。如果您使用的材料數據在 immutable_id 中包含 ("oqmd-"),請引用 OQMD。最後,如果您為了視覺化目的使用相圖,或在 Materials Explorer 中使用晶體瀏覽器,請致謝 Crystal Toolkit。
欲了解更多關於 LeMaterial 的資訊並參與其中:
- 加入社群的表單
- Hugging Face Space
- Github