IBM/materials
Foundation Model for Materials - FM4M
IBM /materials – 재료용 기초 모델 (FM4M)
무엇인가요
- 분자 및 재료의 다양한 표현 방식 (SMILES 문자열, SELFIES 문자열, 분자 그래프, 3차원 원자 위치, 전자 밀도 격자 등)을 이해할 수 있는 오픈소스 사전 훈련 기초 모델 모음입니다.
- 각 모델은 막대한 화학 데이터셋(최대 9100만 SMILES, 10억 개 이상의 분자, 150만 개 이상의 3차원 구조)에서 훈련되었으며, 그대로 사용하여 특징 추출이 가능하거나, 세부 조정을 통해 물성 예측, 양자 물성 회귀, 생성 설계 등의 하류 작업에 활용할 수 있습니다.
- 리포지토리에는 통합된 Python API 또는 Hugging Face Spaces에서 호스팅된 간단한 웹 UI를 통해 어떤 모델이든 호출할 수 있는 가벼운 래퍼인 FM4M‑Kit가 포함되어 있습니다.
주요 모델
| 모델 | 모달리티 | 핵심 아키텍처 | 일반적인 사용 사례 |
|---|---|---|---|
| SMI‑TED | SMILES 문자열 | Transformer 인코더-디코더 (약 289M 파라미터) | 양자 물성 예측, 시퀀스-투-시퀀스 작업 |
| SMI‑SSED | SMILES 문자열 | Mamba 기반 인코더-디코더 (빠른 추론) | SMI‑TED와 동일하지만 더 빠른 속도 |
| SELFIES‑TED | SELFIES 문자열 | BART 스타일 Transformer | 물성 예측 및 자기 회귀적 분자 생성 |
| MHG‑GED | 분자 그래프 | GNN 인코더 + 분자 하이퍼그래프 문법 디코더 | 유효한 분자 생성 및 그래프 기반 회귀 |
| POS‑EGNN | 3차원 원자 그래프 | 등변 기하 텐서 네트워크 | MD 시뮬레이션용 기계학습 포텐셜 |
| 3DGrid‑VQGAN | 3차원 전자 밀도 격자 | VQ‑GAN 인코더-디코더 | 고차원 양자 데이터를 잠재 벡터로 압축 |
| SMILESDFT‑CLIP | 다모달 (SMILES + 3차원 밀도) | 공동 VQ‑GAN + Transformer (대조적) | 문자열 및 필드 모달 간 정렬된 표현 학습 |
| MOL‑MOE | 다시점 (SMILES, SELFIES, 그래프) | 전문가 혼합 (Mixture‑of‑Experts) | 보완적인 시점을 융합하여 더 정확한 물성 예측 |
| STR‑Bamba | 문자열 (SMILES/SELFIES) | 하이브리드 Transformer‑Mamba‑2 | 여러 문자열 인코딩을 유연하게 처리 |
| TDiMS | 서술자 (SMILES) | 분자 내 부분 구조의 위상적 거리 | 가벼우며 해석 가능한 특징 – 사전 훈련 필요 없음 |
시작하기
- Conda 환경 생성
conda create -n fm4m python=3.9.8 conda activate fm4m - 의존성 설치
pip install -r requirements.txt # CUDA 버전에 맞는 torch-scatter 설치 예: pip install torch-scatter -f https://data.pyg.org/whl/torch-$(python -c "import torch; print(torch.__version__.split('+')[0])")+cu118.html - 사용 방식 선택
- 직접 모델 –
models/<model_name>/로 이동하여 해당 폴더의 README 또는 노트북을 따르세요. - FM4M‑Kit (권장) – 래퍼를 가져와 단일 함수를 호출하세요:
import fm4m # SELFIES‑TED에서 특징 추출 feats = fm4m.get_representation(model="selfies-ted", data=my_smiles) # 단일 모델로 하류 회귀기 학습 score = fm4m.single_modal( model="MHG-GED", x_train=X_train, y_train=y_train, x_test=X_test, y_test=y_test, downstream_model="DefaultRegressor" ) # 여러 모달리티 통합 score = fm4m.multi_modal( model_list=["SELFIES-TED", "MHG-GED", "SMI-TED"], x_train=X_train, y_train=y_train, x_test=X_test, y_test=y_test, downstream_model="DefaultRegressor" ) - 웹 UI – 리포지토리에서 링크된 Hugging Face Space를 열고 드래그 앤 드롭 인터페이스를 사용해 데이터를 업로드하고, 모델을 선택하여 빠르게 XGBoost 기반 하류 작업을 실행하세요.
- 직접 모델 –
리포지토리 구조
materials/
├─ models/ # 유모달 모델별 폴더 (smi_ted/, selfies_ted/, …)
│ ├─ fm4m.py # 핵심 래퍼 유틸리티
│ └─ …
├─ examples/ # 엔드투엔드 파이프라인을 보여주는 Jupyter 노트북
│ ├─ fm4m_example.ipynb
│ └─ battery_example.ipynb
├─ requirements.txt # Python 종속성
└─ README.md (이 파일)
FM4M를 사용할 때
- 화학 또는 재료 데이터(SMILES, 그래프, 3차원 구조)를 보유하고 있으며, 모델을 처음부터 훈련하지 않고도 고품질 임베딩이 필요할 때.
- 다양한 분자 표현 방식이 하류 예측에 미치는 영향을 비교하고 싶을 때.
- 분자 동역학 시뮬레이션에서 DFT 수준의 정확도를 달성하기 위한 사전 훈련된 ML 포텐셜(POS‑EGNN)이 필요할 때.
- 생성 화학(SELFIES‑TED, MHG‑GED)에 관심이 있으며, 문법적으로 유효한 분자를 생성하고 싶을 때.
커뮤니티 및 지원
- IBM 친화적 라이선스 하에 오픈소스이며, 풀 리퀘스트를 통해 기여를 환영합니다.
- 모델은 Hugging Face에 호스팅되어 있으며, 빠른 탐색을 위한 GUI가 제공됩니다.
- 팀은 정기적으로 튜토리얼과 워크숍(2025 MRS, 2025 AAAI, 2024 NeurIPS 등)을 운영하며 AI 얼라이언스 내에서 워킹 그룹을 유지하고 있습니다.
참고 문헌
- README에는 각 모델에 대한 논문(Nature Communications Chemistry 2025, NeurIPS 2024 등)이 목록으로 나와 있어 기술적 세부 정보를 더 깊이 이해할 수 있습니다.
요약하면, IBM/materials는 최신 AI를 재료 과학 및 화학 연구에 즉시 적용할 수 있도록 하는, 대규모 다모달 기초 모델 툴박스를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트