IBM/materials

Foundation Model for Materials - FM4M

IBM /materials – 재료용 기초 모델 (FM4M)

무엇인가요

  • 분자 및 재료의 다양한 표현 방식 (SMILES 문자열, SELFIES 문자열, 분자 그래프, 3차원 원자 위치, 전자 밀도 격자 등)을 이해할 수 있는 오픈소스 사전 훈련 기초 모델 모음입니다.
  • 각 모델은 막대한 화학 데이터셋(최대 9100만 SMILES, 10억 개 이상의 분자, 150만 개 이상의 3차원 구조)에서 훈련되었으며, 그대로 사용하여 특징 추출이 가능하거나, 세부 조정을 통해 물성 예측, 양자 물성 회귀, 생성 설계 등의 하류 작업에 활용할 수 있습니다.
  • 리포지토리에는 통합된 Python API 또는 Hugging Face Spaces에서 호스팅된 간단한 웹 UI를 통해 어떤 모델이든 호출할 수 있는 가벼운 래퍼인 FM4M‑Kit가 포함되어 있습니다.

주요 모델

모델 모달리티 핵심 아키텍처 일반적인 사용 사례
SMI‑TED SMILES 문자열 Transformer 인코더-디코더 (약 289M 파라미터) 양자 물성 예측, 시퀀스-투-시퀀스 작업
SMI‑SSED SMILES 문자열 Mamba 기반 인코더-디코더 (빠른 추론) SMI‑TED와 동일하지만 더 빠른 속도
SELFIES‑TED SELFIES 문자열 BART 스타일 Transformer 물성 예측 자기 회귀적 분자 생성
MHG‑GED 분자 그래프 GNN 인코더 + 분자 하이퍼그래프 문법 디코더 유효한 분자 생성 및 그래프 기반 회귀
POS‑EGNN 3차원 원자 그래프 등변 기하 텐서 네트워크 MD 시뮬레이션용 기계학습 포텐셜
3DGrid‑VQGAN 3차원 전자 밀도 격자 VQ‑GAN 인코더-디코더 고차원 양자 데이터를 잠재 벡터로 압축
SMILESDFT‑CLIP 다모달 (SMILES + 3차원 밀도) 공동 VQ‑GAN + Transformer (대조적) 문자열 및 필드 모달 간 정렬된 표현 학습
MOL‑MOE 다시점 (SMILES, SELFIES, 그래프) 전문가 혼합 (Mixture‑of‑Experts) 보완적인 시점을 융합하여 더 정확한 물성 예측
STR‑Bamba 문자열 (SMILES/SELFIES) 하이브리드 Transformer‑Mamba‑2 여러 문자열 인코딩을 유연하게 처리
TDiMS 서술자 (SMILES) 분자 내 부분 구조의 위상적 거리 가벼우며 해석 가능한 특징 – 사전 훈련 필요 없음

시작하기

  1. Conda 환경 생성
    conda create -n fm4m python=3.9.8
    conda activate fm4m
    
  2. 의존성 설치
    pip install -r requirements.txt
    # CUDA 버전에 맞는 torch-scatter 설치 예: 
    pip install torch-scatter -f https://data.pyg.org/whl/torch-$(python -c "import torch; print(torch.__version__.split('+')[0])")+cu118.html
    
  3. 사용 방식 선택
    • 직접 모델models/<model_name>/로 이동하여 해당 폴더의 README 또는 노트북을 따르세요.
    • FM4M‑Kit (권장) – 래퍼를 가져와 단일 함수를 호출하세요:
      import fm4m
      
      # SELFIES‑TED에서 특징 추출
      feats = fm4m.get_representation(model="selfies-ted", data=my_smiles)
      
      # 단일 모델로 하류 회귀기 학습
      score = fm4m.single_modal(
          model="MHG-GED",
          x_train=X_train, y_train=y_train,
          x_test=X_test,   y_test=y_test,
          downstream_model="DefaultRegressor"
      )
      
      # 여러 모달리티 통합
      score = fm4m.multi_modal(
          model_list=["SELFIES-TED", "MHG-GED", "SMI-TED"],
          x_train=X_train, y_train=y_train,
          x_test=X_test,   y_test=y_test,
          downstream_model="DefaultRegressor"
      )
      
    • 웹 UI – 리포지토리에서 링크된 Hugging Face Space를 열고 드래그 앤 드롭 인터페이스를 사용해 데이터를 업로드하고, 모델을 선택하여 빠르게 XGBoost 기반 하류 작업을 실행하세요.

리포지토리 구조

materials/
├─ models/                # 유모달 모델별 폴더 (smi_ted/, selfies_ted/, …)
│   ├─ fm4m.py            # 핵심 래퍼 유틸리티
│   └─ …
├─ examples/              # 엔드투엔드 파이프라인을 보여주는 Jupyter 노트북
│   ├─ fm4m_example.ipynb
│   └─ battery_example.ipynb
├─ requirements.txt       # Python 종속성
└─ README.md (이 파일)

FM4M를 사용할 때

  • 화학 또는 재료 데이터(SMILES, 그래프, 3차원 구조)를 보유하고 있으며, 모델을 처음부터 훈련하지 않고도 고품질 임베딩이 필요할 때.
  • 다양한 분자 표현 방식이 하류 예측에 미치는 영향을 비교하고 싶을 때.
  • 분자 동역학 시뮬레이션에서 DFT 수준의 정확도를 달성하기 위한 사전 훈련된 ML 포텐셜(POS‑EGNN)이 필요할 때.
  • 생성 화학(SELFIES‑TED, MHG‑GED)에 관심이 있으며, 문법적으로 유효한 분자를 생성하고 싶을 때.

커뮤니티 및 지원

  • IBM 친화적 라이선스 하에 오픈소스이며, 풀 리퀘스트를 통해 기여를 환영합니다.
  • 모델은 Hugging Face에 호스팅되어 있으며, 빠른 탐색을 위한 GUI가 제공됩니다.
  • 팀은 정기적으로 튜토리얼과 워크숍(2025 MRS, 2025 AAAI, 2024 NeurIPS 등)을 운영하며 AI 얼라이언스 내에서 워킹 그룹을 유지하고 있습니다.

참고 문헌

  • README에는 각 모델에 대한 논문(Nature Communications Chemistry 2025, NeurIPS 2024 등)이 목록으로 나와 있어 기술적 세부 정보를 더 깊이 이해할 수 있습니다.

요약하면, IBM/materials는 최신 AI를 재료 과학 및 화학 연구에 즉시 적용할 수 있도록 하는, 대규모 다모달 기초 모델 툴박스를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트