OpenMed CodonRoBERTa 다중 종 mRNA 언어 모델 출시
OpenMed CodonRoBERTa 다중 종 mRNA 언어 모델 출시
OpenMed는 CodonRoBERTa-large-v2(당혹도 4.10, CAI 0.404)를 포함한 엔드‑투‑엔드 단백질 엔지니어링 파이프라인과 55 GPU‑시간(≈ $165)으로 학습된 25종 코돈 최적화 모델 스위트를 출시했습니다.
OpenMed CodonRoBERTa 다중 종 mRNA 언어 모델 출시
TL;DR – OpenMed는 새로운 트랜스포머 언어 모델 패밀리로 구동되는 코돈 최적화 단계를 추가한 엔드‑투‑엔드 단백질 엔지니어링 파이프라인을 출시했으며, CodonRoBERTa‑large‑v2는 당혹도 4.10과 CAI 스피어만 상관계수 0.404를 달성했고, 25종을 포괄하는 다중 종 스위트는 단 55 GPU‑시간(≈ $165)으로 학습되었습니다. 이 스위트에는 311 M 파라미터의 범용 모델과 인간, E. coli, CHO의 세 가지 전문 모델이 포함되어 이전 접근법을 능가하고 빠른 발현 준비 DNA 생성을 가능하게 합니다.
1. 릴리스에 포함된 내용
| 구성요소 | 설명 | 핵심결과 |
|---|---|---|
| 단백질 접힘 | 30개의 단백질 체인에 대한 ESMFold v1 예측 | 평균 PTM = 0.79 (높은 토폴로지 신뢰도) |
| 서열 설계 | 스캐폴드 7K00에 대한 ProteinMPNN | 42 % 아미노산 회수 |
| mRNA 최적화 | 250 k E. coli CDS에 대해 훈련된 새로운 트랜스포머 모델을 25종에 걸쳐 381 k CDS로 확장 | CodonRoBERTa‑large‑v2: 당혹도 4.10, CAI 스피어만 0.404; 25종을 포괄하는 4개의 생산 모델이 55 GPU‑시간에 훈련됨 |
접힘 및 설계 단계는 기존 오픈소스 도구(ESMFold, ProteinMPNN)를 재사용합니다. 코돈 최적화 단계는 완전히 새로운 것으로, 종 조건을 포함한 코돈 수준 시퀀스로 훈련된 RoBERTa‑스타일 언어 모델 스위트입니다.
2. 아키텍처 탐색 – 코돈에 가장 적합한 트랜스포머는?
| 모델 | 파라미터 | 아키텍처 | 훈련 데이터 (250 k E. coli CDS) |
|---|---|---|---|
| CodonBERT (baseline) | 6 M | BERT‑tiny (6 레이어) | – |
| ModernBERT‑base | 90 M | ModernBERT (22 레이어, RoPE) | – |
| CodonRoBERTa‑base | 92 M | RoBERTa (12 레이어) | – |
| CodonRoBERTa‑large | 312 M | RoBERTa (24 레이어) | – |
| CodonRoBERTa‑large‑v2 | 312 M | RoBERTa (24 레이어, 정제된 학습률 및 워밍업) | – |
Results on the E. coli test set
| 모델 | 당혹도 | CAI 스피어만 | 동의어 회복 |
|---|---|---|---|
| CodonRoBERTa‑large‑v2 | 4.10 | 0.404 | 7.7 % |
| CodonRoBERTa‑base | 4.01 | 0.219 | 8.5 % |
| CodonRoBERTa‑large | 4.01 | 0.025 | 7.6 % |
| ModernBERT‑base | 26.24 | 0.070 | 8.5 % |
| CodonBERT (baseline) | 17.18 | –0.629 | 0 % |
주요 내용
- RoBERTa는 당혹도와 CAI 상관계수 모두에서 ModernBERT보다 6배 더 우수하여, 고전적인 RoBERTa MLM 아키텍처가 코돈 시퀀스의 통계적 구조에 더 적합함을 보여줍니다.
- 영어 텍스트에 대한 사전학습은 성능을 저하시킵니다 – ModernBERT를 영어 체크포인트로 초기화하면 코돈 패턴 학습 능력이 감소합니다.
- 하이퍼파라미터 튜닝이 규모보다 더 중요합니다 – v2 체크포인트(lr 5e‑5, warm‑up 2 k steps)는 당혹도가 약간 높음에도 CAI 상관계수를 16배 개선했습니다.
- 92 M 파라미터의 베이스 모델은 실용적인 저비용 대안이며, 파라미터가 1/3에 불과하면서도 대형 모델과 동등한 당혹도를 제공합니다.
3. 엔드‑투‑엔드 파이프라인
3.1 ESMFold를 이용한 단백질 접힘
- 도구: Meta의 ESMFold v1 (단일 시퀀스, MSA 없음).
- 성능: 30개의 PDB 체인에 대해 평균 PTM = 0.79, 잔기당 pLDDT ≈ 34 (다중 체인 대상에서는 낮음). 접힘은 A100 기준 단백질당 10–30 s가 소요됩니다.
3.2 ProteinMPNN을 이용한 서열 설계
- 도구: ProteinMPNN (그래프 기반 역접힘).
- 결과: 스캐폴드 7K00에 대해 세 개의 서열을 생성했으며, 온도 0.1에서 최상의 서열이 원래 아미노산의 42 %를 회수했습니다.
3.3 CodonRoBERTa를 이용한 mRNA 최적화
- 문제 – 전통적인 CAI 테이블은 각 코돈을 독립적으로 교체하여 문맥을 무시하고 반복적이며 때때로 최적이 아닌 서열을 만들게 됩니다.
- 해결책 – 코돈 토큰에 대한 마스크드 언어 모델링(MLM)을 적용해 문맥적 코돈 선호도를 학습합니다. 모델은 주변 문맥을 이용해 마스크된 코돈을 예측함으로써 장거리 의존성을 포착합니다.
- 평가 지표
- 당혹도 – CodonRoBERTa‑large‑v2의 경우 4.10 (마스크당 약 4개의 동등하게 가능한 코돈).
- CAI 스피어만 상관계수 – 0.404 (p < 10⁻²⁰), 생물학적으로 선호되는 코돈 사용과 강하게 일치함을 나타냅니다.
- 동의어 회복 – Top‑1 동의어 예측 12.1 %, 모델이 아미노산 제약을 잘 유지함을 보여줍니다.
- 사용 예시 (Python, Hugging Face Transformers):
from transformers import RobertaForMaskedLM model = RobertaForMaskedLM.from_pretrained("OpenMed/CodonRoBERTa-large-v2") tokenizer = CodonTokenizer() # 69‑token codon vocab seq = "ATG GCT AAA GGT ..." inputs = tokenizer(seq, return_tensors="pt") with torch.no_grad(): scores = model(**inputs).logits
4. 25 종으로 확장 – 모든 유기체를 아는 단일 모델
4.1 데이터 엔지니어링
- 25종(19 박테리아, 3 효모, 3 포유류)의 RefSeq CDS를 다운로드했습니다.
- 검증 단계: 시작/종료 코돈, 길이 % 3 = 0, 내부 정지코돈 없음.
- 최종 데이터셋: 381 283 시퀀스 (≈ 3 GB), 종별 95 %/5 % 훈련/테스트로 분할했습니다.
4.2 종‑조건 토크나이저
- 69‑토큰 코돈 어휘에 25개의 특수 종 토큰을 추가해 94‑토큰 어휘를 만들었습니다.
- 각 시퀀스는 해당 종 토큰(예:
[HUMAN])으로 앞에 붙이며, 이를 통해 모델은 파라미터를 공유하면서도 종별 코돈 편향을 학습합니다.
4.3 범용 베이스 모델
- 아키텍처: RoBERTa‑large (311.9 M 파라미터) + 94‑토큰 어휘.
- 훈련: 4 × A100 GPU에서 48 h, 50 k 스텝(≈ 4.5 epoch), bf16 혼합 정밀도, Fully Sharded Data Parallel (FSDP).
- 테스트 당혹도: 24.9 – 단일 종 모델보다 높으며, 25개의 서로 다른 코돈 사용 패턴을 모두 포착해야 하기 때문입니다.
4.4 종‑특화 미세조정
| 종 | 훈련 시퀀스 | 미세조정 단계 | GPU‑시간 | 테스트 당혹도 |
|---|---|---|---|---|
| Human (치료용 mRNA) | 131 k | 15 k | 4 h | 24.3 |
| E. coli (박테리아 발현) | 8.5 k | 5 k | 0.5 h | 25.3 |
| CHO (생물제약 포유류) | 42.5 k | 10 k | 2.5 h | 25.5 |
Human 전문 모델은 파라미터를 훨씬 적게 사용하면서도 범용 베이스보다 2.4 % 낮은 당혹도를 보여, 다종 기반 전이학습의 이점을 확인시켜 줍니다.
4.5 모델 스위트 (Hugging Face에 공개)
OpenMed/CodonRoBERTa-large-multispecies– 311 M 파라미터의 범용 모델.OpenMed/CodonRoBERTa-large-human– 인간 세포용 전문 모델(전체 성능 최고).OpenMed/CodonRoBERTa-large-ecoli– E. coli 전용 전문 모델.OpenMed/CodonRoBERTa-large-cho– CHO 세포용 전문 모델.OpenMed/CodonRoBERTa-large-v2– 가장 낮은 당혹도(4.10)와 최고 CAI 상관계수(0.404)를 기록한 E. coli 단일 종 모델.OpenMed/CodonRoBERTa-base– 92 M 파라미터의 효율적인 대안.
모든 모델은 Apache‑2.0 라이선스를 따르며, safetensors 형식으로 저장되고 from_pretrained() 로 로드할 수 있습니다.
5. 엔드‑투‑엔드 워크플로우 예시
- Fold – ESMFold를 사용해 목표 단백질의 3‑D 구조를 얻습니다.
- Design – 기능성 잔기를 고정한 채 ProteinMPNN을 실행해 후보 아미노산 서열을 생성합니다.
- Validate – 후보들을 ESMFold로 다시 접힘시켜 pLDDT/PTM이 높은 것만 유지합니다.
- Optimize – 선택된 아미노산 서열을 적절한 CodonRoBERTa 전문 모델(예:
CodonRoBERTa-large-human)에 전달해 코돈 최적화 DNA 문자열을 얻습니다. - Synthesize – DNA를 주문·클론하고 선택된 숙주에서 발현을 테스트합니다.
전체 계산 루프는 일반적인 단백질에 대해 단일 GPU에서 1시간 미만에 실행되며, 과거에 수주가 걸리던 습관적 실험 과정을 크게 단축합니다.
6. 현황 및 향후 방향
6.1 최신 모델과 비교
| 모델 | 파라미터 | 데이터 크기 | 종 조건 | 보고된 CAI / 번역 효율성 지표 |
|---|---|---|---|---|
| OpenMed CodonRoBERTa | 312 M | 381 k CDS (25 species) | 25 토큰을 사용한 단일 모델 | CAI 스피어만 0.404 (human specialist) |
| mRNABERT (Xiong et al., 2025) | 86 M | 18 M 시퀀스 | 종 토큰 없음 | R² 0.66 on translation efficiency |
| NUWA (Zhong et al., 2026) | – | 115 M 시퀀스, ~25 k species | 세 개의 도메인‑특화 모델 | 11/13 벤치마크에서 CodonBERT 능가 |
OpenMed의 독특한 기여
- 단일, 종‑조건 모델 – 25종을 모두 포괄하는 하나의 모델로, NUWA의 세 개 도메인‑특화 모델과 달리 별도 모델이 필요 없습니다.
- 전이학습 입증 – 범용 베이스를 8.5 k E. coli CDS에 미세조정하면 전문 모델이 베이스보다 우수함을 보여줍니다.
- 완전하고 실행 가능한 파이프라인 제공 – 접힘 → 설계 → 코돈 최적화까지 모든 코드와 가중치를 관용적인 라이선스로 공개합니다.
6.2 진행 중인 연구 – CodonJEPA
- 목표 – 토큰‑레벨 MLM을 Joint Embedding Predictive Architecture(JEPA)로 교체해 동의어 코돈을 임베딩 공간에서 구분되지 않게 합니다.
- 초기 결과 (15 k 스텝, 동일 데이터):
- 동의어 견고성(코사인 유사도) = 0.9997 (JEPA) vs 0.9414 (MLM).
- 차원 붕괴 관찰(91 % 분산이 단일 컴포넌트에 집중); VICReg 정규화를 강화하는 작업 진행 중.
- 붕괴가 해결되면 JEPA는 본질적으로 아미노산을 인식하는 코돈 임베딩을 제공할 수 있어, MLM이 제공하지 못하는 기능을 구현합니다.
6.3 로드맵 (다음 12개월)
- CodonRoBERTa 확장 – 공개된 36 M 시퀀스 mRNABERT 데이터셋에 대해 학습하고 ProtT5‑XL과의 대비 정렬을 추가합니다.
- 미세조정 확대 – 효모, 마우스, Pichia 등 추가 유기체에 대해 미세조정하고 업데이트된 전문 체크포인트를 공개합니다.
- CodonJEPA 최종화 – 차원 붕괴 해결, mRNABERT와 벤치마크, 파이프라인에 선택적 임베딩 레이어로 통합합니다.
- 파이프라인 강화 – RFdiffusion을 이용한 de‑novo 백본 생성 추가 및 발현‑안정성 예측 헤드 도입.
7. 실용적인 배포
- Inference hardware – 16 GB 이상 VRAM을 가진 단일 A100 또는 92 M 파라미터 베이스 모델을 위한 12 GB 이상 GPU.
- Software stack – PyTorch 2.5+,
transformers≥ 4.40,flash‑attn2(효율적인 어텐션), FSDP (훈련). - Licensing – 모든 구성 요소(ESMFold, ProteinMPNN, OpenMed 모델)는 MIT 또는 Apache‑2.0 라이선스를 적용받아 상업적 사용이 가능합니다.
- Cost – 전체 훈련 비용은 AWS 스팟 인스턴스(4 × A100, 55 GPU‑시간) 기준 약 $165였습니다.
8. 참고문헌
- Jumper, J. et al. “Highly accurate protein structure prediction with AlphaFold.” Nature (2021).
- Lin, Z. et al. “Evolutionary‑scale prediction of atomic‑level protein structure with a language model.” Science (2023).
- Dauparas, J. et al. “Robust deep learning‑based protein sequence design using ProteinMPNN.” Science (2022).
- Cheng, J. et al. “CodonBERT: a language model for codon optimization.” Nucleic Acids Research (2024).
- Xiong, Y. et al. “mRNABERT: advancing mRNA sequence design with a universal language model and comprehensive dataset.” Nature Communications (2025).
- Zhong, Y. et al. “Large mRNA language foundation modeling with NUWA for unified sequence perception and generation.” bioRxiv (2026).
- Warner, B. et al. “ModernBERT: Smarter, Better, Faster, Longer.” arXiv (2024).
전체 코드, 훈련된 체크포인트 및 25‑종 CDS 데이터셋은 OpenMed 조직 아래 Hugging Face에 공개될 예정입니다.