LeMaterial v1.0: LeMat-Bulk 데이터셋 출시

LeMaterial v1.0은 Materials Project, Alexandria, OQMD의 670만 개 항목을 7가지 속성을 가진 표준화된 형식으로 통합하여 재료 발견을 가속화하는 오픈 소스 이니셔티브인 LeMat-Bulk 데이터셋 출시와 함께 시작됩니다.

왜 LeMaterial인가?

LeMaterial은 Materials Project, Alexandria, OQMD의 데이터를 일관되고 체계적인 속성을 가진 고품질 리소스로 통합 및 표준화함으로써 주요 재료 데이터셋의 파편화 문제를 해결합니다.

양자 화학과 머신러닝의 교차점에 있는 재료 과학의 세계는 더 밝은 LED부터 전기 화학 배터리, 더 효율적인 태양광 전지 및 재활용 가능한 플라스틱에 이르기까지 무궁무진한 기회로 가득 차 있습니다. 대규모의 구조화된 데이터셋에 머신러닝을 활용함으로써 연구자들은 전례 없는 규모로 신소재의 고처리량 스크리닝 및 테스트를 수행할 수 있으며, 원하는 특성을 가진 새로운 화합물의 발견 주기를 크게 가속화할 수 있습니다. 이러한 패러다임에서 데이터는 실험을 안내하고, 비용을 절감하며, 그 어느 때보다 빠르게 돌파구를 마련할 수 있는 ML 모델을 구동하는 필수적인 연료가 됩니다.

이 분야는 Materials Project, Alexandria, OQMD와 같이 모두 오픈 소스이며 CC-BY-4.0 라이선스 하에 있는 매우 완전한 데이터셋에 의해 추진됩니다. 그러나 이러한 데이터셋은 형식, 매개변수 및 범위가 서로 달라 다음과 같은 과제를 안고 있습니다:

  • 데이터셋 통합 문제 (예: 일관되지 않은 형식 또는 필드 정의, 호환되지 않는 계산)
  • 데이터셋 구성의 편향 (예: 산화물 및 배터리 재료에 집중된 Materials Project)
  • 제한된 범위 (예: 재료 특성보다는 양자 화학 계산에 집중하는 NOMAD)
  • 서로 다른 데이터베이스 간의 유사한 재료에 대한 명확한 연결 또는 식별자 부족

이러한 파편화된 환경은 AI4Science 및 재료 정보학 연구자들이 기존 데이터를 효과적으로 활용하는 것을 어렵게 만듭니다. 애플리케이션이 기초 ML 모델 학습, 정확한 상도(phase diagram) 구축, 신소재 식별 또는 화학 공간의 효과적인 탐색을 포함하든 상관없이 간단한 해결책은 없습니다. Optimade와 같은 노력들이 구조 데이터를 표준화하고 있지만, 재료 특성의 불일치나 데이터셋 범위의 편향 문제는 해결하지 못하고 있습니다.

LeMaterial은 Materials Project, Alexandria, OQMD라는 세 개의 주요 데이터베이스의 데이터를 통합하고 표준화하여 일관되고 체계적인 속성을 가진 고품질 리소스로 변환함으로써 이러한 과제를 해결합니다.

깨끗하고 통합되며 표준화된 데이터셋 달성

LeMat-Bulk v1.0은 Optimade 형식, 해싱 기반의 재료 핑거프린트 및 시각화 도구를 사용하여 670만 개의 항목과 7가지 재료 특성을 가진 정제되고 병합된 표준화된 데이터셋을 제공합니다.

LeMat-Bulk는 허용적인 라이선스(CC-BY-4.0)를 가진 대규모 병합 데이터셋 그 이상입니다. 일관된 속성을 가진 670만 개의 항목을 통해, 연구 워크플로우를 단순화하고 데이터 품질을 개선하도록 설계된 재료 과학을 위한 큐레이션된 표준화된 오픈 생태계를 구축하기 위한 기초적인 단계 역할을 합니다.

Release Description & Value Date
v.1.0 * 다양한 소스로부터의 데이터 수집 및 병합: 여러 필드와 DFT functional (PBE, PBESol, SCAN)을 포함한 Materials Project, Alexandria 및 OQMD 데이터셋 * 데이터 정제: 설정된 표준을 따르지 않는 데이터 포인트 식별 및 제거 (예: 호환되지 않는 계산) * 표준화: Optimade 표준을 사용하여 데이터베이스 전반의 필드 세트를 균일하게 형식화 * 재료 핑거프린트: 검증된 해싱 함수를 사용하여 각 재료에 고유 식별자를 부여하여 중복 제거 가능 * 접근성 및 시각화: 제안된 새로운 데이터셋은 Materials Project에서 개발한 Crystal Toolkit, Pymatgen 및 Dash 컴포넌트를 기반으로 한 오픈 소스 도구 덕분에 시각화할 수 있음 (상도, 재료 탐색기) 2024년 12월 10일
v.1.1 * 새로운 데이터: Materials Project 데이터베이스의 많은 재료에 대한 전하 데이터 계산 (추가 53k 데이터 포인트, 밴드 갭 정보, 통합 에너지 보정 체계) * 평가: 코드 해싱 함수 벤치마크 * 새로운 기능: 재료 유사성 메트릭 및 유사 구조 검색 도구 * 새로운 모델: 데이터로 학습된 Equiformerv2 및 FAENet * 데이터 검증: 필드, 형식 등의 호환성 확인 2025년 1분기
Future releases * 새로운 데이터: Materials Project의 r2SCAN 데이터 출시 * 새로운 표면 데이터셋: OC20 & OC22 데이터셋 및 벌크 이외의 모델(표면 및 slab+ads 및 분자 구조) 지원 능력 * 추가 조화: 유사한 형식으로 MPTrj, OMat24의 궤적 포함, DB에 관계형 데이터 포함 2025년 2분기

연구자의 요구(일관된 계산, 재료 중복 제거 또는 포괄적인 탐색)에 따라 맞춤형 워크플로우를 가능하게 하는 다양한 데이터셋과 하위 세트를 제공합니다:

  • Compatibility: 이 하위 세트는 혼합 시 호환 가능한 계산만 제공합니다. 현재 3가지 functional (PBE, PBESol 및 SCAN)에서 사용할 수 있습니다.
  • Non-compatible: 이 하위 세트는 호환성 하위 세트에 포함되지 않은 모든 재료를 제공합니다.
  • LeMat-BulkUnique: 이 데이터 세트 분할은 우리의 구조 핑거프린트 알고리즘을 사용하여 중복이 제거된 재료를 제공합니다. PBE, PBESol, SCAN functional에 대해 3개의 하위 세트로 제공됩니다.

잘 검증된 재료 핑거프린트 통합

LeMaterial은 빠른 신규성 탐지, 중복 제거 및 데이터셋 간 연결을 가능하게 하는 해싱 기반의 재료 핑거프린트를 도입합니다.

이 표준화된 데이터셋을 구축하는 것 외에도, LeMaterial의 주요 기여 중 하나는 각 재료에 고유 식별자를 할당하는 해싱 함수를 통해 재료 핑거프린트의 정의를 제안하는 것입니다.

데이터베이스에 비해 재료가 새로운지 식별하는 현재의 접근 방식은 주로 유사성 메트릭에 의존해 왔으며, 이는 기존 데이터베이스에서 신규성을 스크리닝하기 위한 조합적 노력을 필요로 합니다. 데이터셋에서 더 빠른 신규성 탐지를 제공하기 위해, Entalpic은 재료의 핑거프린트를 계산하기 위한 해싱 방법을 도입합니다.

위는 핑거프린팅의 세부 사항입니다. 우리는 결정 구조에 결합 알고리즘(예: EconNN)을 사용하여 그래프를 추출한 다음, Weisfeiler-Lehman 알고리즘을 계산하여 해시를 얻습니다. 이 해시는 조성 및 공간군 정보와 결합되어 재료 핑거프린트를 생성합니다.

우리의 핑거프린팅 접근 방식은 다음과 같은 여러 이점을 제공합니다:

  • 재료가 새로운지 또는 이미 카탈로그에 있는지 신속하게 식별
  • 데이터셋에 중복 및 불일치가 없음을 보장
  • 데이터셋 간의 재료 연결 허용
  • energy above the hull과 같은 열역학적 특성에 대한 더 효율적인 계산 지원

아래는 데이터셋의 모든 중복을 찾기 위해 우리의 해시 함수와 Pymatgen의 StructureMatcher를 비교한 것입니다. 실험은 구조가 매우 다른 두 데이터셋에서 실행되었습니다.

데이터셋 구조 수 해시 함수 작업 시간 (12개 CPU 병렬 처리) StructureMatcher 작업 시간 (64개 CPU 병렬 처리)
Carbon-24 10,153 100초 17시간
MPTS-52 40,476 330초 4.9시간

또한, 우리는 해싱 함수의 유효성을 평가하기 위해 잘 큐레이션된 벤치마크 세트를 출시할 계획입니다. 예를 들어, 우리는 다음을 조사했습니다:

  • 서로 다른 재료가 기존 데이터베이스의 재료 식별 태그에 따라 서로 다른 해시를 생성하는지
  • 재료에 작은 노이즈를 추가하거나 대칭 연산을 적용하는 것이 동일한 해시로 이어지는지
  • 데이터베이스 내 또는 간에 동일한 해시를 공유하는 재료가 실제로 동일한 재료인지 — 수동 및 DFT 확인을 통해
  • 기존 데이터베이스에서 Pymatgen의 StructureMatcher와 비교했을 때 우리의 해시가 얼마나 빠르고 정확한지

🤗 커뮤니티에 드리는 말씀: 우리의 목표는 이 핑거프린트 방법을 재료 데이터베이스의 중복을 제거하고 신규 재료를 찾는 유일한 솔루션으로 위치시키는 것이 아니라, 이 질문에 대한 논의를 촉진하는 것입니다. 이 해싱 기술의 현재 한계 중 하나는 무질서 구조(disordered structures)를 다루지 않는다는 점입니다. 우리는 커뮤니티가 합의점을 찾도록 유도하는 동시에, 비교적 단순하고 효율적인 핑거프린트 방법을 제안하고자 합니다.

LeMaterial 활용: 애플리케이션 및 영향

LeMaterial은 확장된 상도 탐색, 교차 데이터베이스 특성 비교, 빠른 신규성 탐지 및 ML 원자 간 포텐셜 학습을 가능하게 합니다.

장기적으로 LeMaterial은 대규모의 큐레이션된 데이터셋, 머신러닝 모델, 유용한 툴킷 등을 모으는 커뮤니티 주도 이니셔티브가 되는 것을 목표로 합니다. 이는 다음과 같은 광범위한 애플리케이션을 가능하게 하도록 실용적이고 유연하게 설계되었습니다:

  • 확장된 상도 탐색 (상도 탐색기 링크, Materials Project의 다양한 오픈 소스 도구 덕분에 구축됨), 더 넓은 데이터셋으로 구축되어 화학 공간을 더 자세히 분석하기 위해 구성됨. 더 큰 데이터셋을 결합하면 주어진 조성 공간에서 재료 안정성에 대해 더 미세한 해상도를 제공할 수 있음을 의미합니다.

  • 데이터베이스 및 functional 간의 재료 특성 비교: 연구자에게 DFT functional 전반의 데이터를 제공하고 재료 핑거프린트 알고리즘을 통해 재료를 연결함으로써, 서로 다른 매개변수를 통해 계산된 재료 특성을 설정하고 연결할 수 있습니다. 이를 통해 연구자들은 functional이 조성 공간에 따라 어떻게 다르게 행동할 수 있는지에 대한 통찰력을 얻을 수 있습니다.

  • 재료의 신규성 결정. 우리의 해싱 함수는 연구자가 재료가 고유한지 또는 중복인지 신속하게 평가할 수 있게 하여, 발견 프로세스를 간소화하고 불필요한 계산을 방지합니다.

    • 예시 1: 우리의 핑거프린트 방법은 다음 Alexandria 항목(agm002153972, agm002153975)이 동일한 해시를 가져 잠재적으로 동일한 재료임을 식별했습니다. 더 높은 에너지 항목에 대해 relaxation을 수행했을 때, 재료는 더 낮은 에너지 구성으로 이완되었습니다.

    • 예시 2: 생성 모델 학습에 자주 사용되는 다른 데이터셋(AIRSS)에 우리의 해시를 적용했을 때, 동일한 해시를 가진 다음 재료들을 발견했습니다.

      여기서 중요한 점은 Pymatgen의 StructureMatcher는 이 두 단위 세포를 서로 다른 재료로 식별했지만, 실제로는 정확히 동일한 구조라는 것입니다. 여기서 우리의 해싱 알고리즘은 이들이 실제로 동일함을 식별할 수 있었습니다.

  • 예측 ML 모델 학습. 우리는 LeMat-Bulk에서 EquiformerV2와 같은 머신러닝 원자 간 포텐셜을 학습할 수도 있습니다. 이러한 모델은 규모와 데이터 품질, 조성 공간 전반의 편향 제거의 이점을 얻을 것이며, 이 새로운 데이터셋의 이점을 평가하는 것은 흥미로울 것입니다. LeMaterial을 Fairchem와 결합하는 방법에 대한 예시는 Colab에서 확인할 수 있습니다. 우리는 현재 이 데이터셋을 사용하여 EquiformerV2 모델을 학습하는 과정에 있습니다 — 계속 지켜봐 주세요 💫

요약

LeMaterial은 기존 주요 데이터 소스에 대해 통합, 표준화, 추가 정제 및 검증을 수행하여 연구를 가속화하고, ML 모델의 품질을 개선하며, 재료 발견을 더욱 효율적이고 접근 가능하게 만드는 솔루션을 제공합니다.

커뮤니티로서 우리는 종종 이러한 대규모 오픈 소스 데이터베이스의 품질에 큰 가치를 둡니다. 그러나 표준화의 부족은 여러 데이터셋을 활용하는 데 큰 어려움을 줍니다. LeMaterial은 기존 주요 데이터 소스에 대해 통합, 표준화, 추가 정제 및 검증 노력을 수행하는 솔루션을 제공합니다. 이 새로운 오픈 사이언스 프로젝트는 연구를 가속화하고, ML 모델의 품질을 개선하며, 재료 발견을 더욱 효율적이고 접근 가능하게 하도록 설계되었습니다.

우리는 이제 시작일 뿐입니다 — 여전히 결함과 개선할 점이 있다는 것을 알고 있으며, 따라서 여러분의 피드백을 듣고 싶습니다! 이 오픈 소스 이니셔티브에 기여하는 데 관심이 있다면 언제든지 연락해 주세요. 커뮤니티와 함께 새로운 데이터셋, 도구 및 애플리케이션으로 LeMaterial을 계속 확장해 나갈 수 있기를 기대합니다! ⚛️🤗

인용

LeMaterial에서 콘텐츠를 다운로드함으로써 귀하는 콘텐츠가 LeMaterial으로부터 특정 허가를 받지 않고도 복제, 배포, 전송 및 수정될 수 있음을 의미하는 Creative Commons Attribution 4.0 라이선스를 수락하는 것에 동의합니다(단, LeMaterial에 대한 적절한 출처 표기가 제공되어야 함).

연구에서 LeMaterial을 리소스로 사용하는 경우, 당사의 데이터 카드(논문 예정)의 인용 섹션을 인용해 주십시오.

CC-BY-4.0 (Materials Project, Alexandria, OQMD에 사용된 라이선스)는 적절한 인정을 요구합니다. 따라서 immutable_id에 ("mp-")가 포함된 재료 데이터를 사용하는 경우 Materials Project를 인용하십시오. immutable_id에 ("agm-")가 포함된 재료 데이터를 사용하는 경우 Alexandria, PBE 또는 Alexandria PBESol, SCAN을 인용하십시오. immutable_id에 ("oqmd-")가 포함된 재료 데이터를 사용하는 경우 OQMD를 인용하십시오. 마지막으로, 시각화 목적으로 상도(Phase Diagram)를 사용하거나 Materials Explorer의 크리스탈 뷰어를 사용하는 경우 Crystal Toolkit을 명시해 주십시오.


LeMaterial에 대해 더 자세히 알아보고 참여하려면:

  • 커뮤니티 가입 양식
  • Hugging Face Space
  • Github

Sources