OpenMed CodonRoBERTa 다중 종 mRNA 언어 모델 출시

OpenMed CodonRoBERTa 다중 종 mRNA 언어 모델 출시

OpenMed는 CodonRoBERTa-large-v2(당혹도 4.10, CAI 0.404)를 포함한 엔드‑투‑엔드 단백질 엔지니어링 파이프라인과 55 GPU‑시간(≈ $165)으로 학습된 25종 코돈 최적화 모델 스위트를 출시했습니다.

OpenMed CodonRoBERTa 다중 종 mRNA 언어 모델 출시

TL;DR – OpenMed는 새로운 트랜스포머 언어 모델 패밀리로 구동되는 코돈 최적화 단계를 추가한 엔드‑투‑엔드 단백질 엔지니어링 파이프라인을 출시했으며, CodonRoBERTa‑large‑v2는 당혹도 4.10과 CAI 스피어만 상관계수 0.404를 달성했고, 25종을 포괄하는 다중 종 스위트는 단 55 GPU‑시간(≈ $165)으로 학습되었습니다. 이 스위트에는 311 M 파라미터의 범용 모델과 인간, E. coli, CHO의 세 가지 전문 모델이 포함되어 이전 접근법을 능가하고 빠른 발현 준비 DNA 생성을 가능하게 합니다.

1. 릴리스에 포함된 내용

구​성​요​소 설​명 핵​심​결​과
단백질 접힘 30개의 단백질 체인에 대한 ESMFold v1 예측 평균 PTM = 0.79 (높은 토폴로지 신뢰도)
서열 설계 스캐폴드 7K00에 대한 ProteinMPNN 42 % 아미노산 회수
mRNA 최적화 250 k E. coli CDS에 대해 훈련된 새로운 트랜스포머 모델을 25종에 걸쳐 381 k CDS로 확장 CodonRoBERTa‑large‑v2: 당혹도 4.10, CAI 스피어만 0.404; 25종을 포괄하는 4개의 생산 모델이 55 GPU‑시간에 훈련됨

접힘 및 설계 단계는 기존 오픈소스 도구(ESMFold, ProteinMPNN)를 재사용합니다. 코돈 최적화 단계는 완전히 새로운 것으로, 종 조건을 포함한 코돈 수준 시퀀스로 훈련된 RoBERTa‑스타일 언어 모델 스위트입니다.

2. 아키텍처 탐색 – 코돈에 가장 적합한 트랜스포머는?

모델 파라미터 아키텍처 훈련 데이터 (250 k E. coli CDS)
CodonBERT (baseline) 6 M BERT‑tiny (6 레이어)
ModernBERT‑base 90 M ModernBERT (22 레이어, RoPE)
CodonRoBERTa‑base 92 M RoBERTa (12 레이어)
CodonRoBERTa‑large 312 M RoBERTa (24 레이어)
CodonRoBERTa‑large‑v2 312 M RoBERTa (24 레이어, 정제된 학습률 및 워밍업)

Results on the E. coli test set

모델 당혹도 CAI 스피어만 동의어 회복
CodonRoBERTa‑large‑v2 4.10 0.404 7.7 %
CodonRoBERTa‑base 4.01 0.219 8.5 %
CodonRoBERTa‑large 4.01 0.025 7.6 %
ModernBERT‑base 26.24 0.070 8.5 %
CodonBERT (baseline) 17.18 –0.629 0 %

주요 내용

  1. RoBERTa는 당혹도와 CAI 상관계수 모두에서 ModernBERT보다 6배 더 우수하여, 고전적인 RoBERTa MLM 아키텍처가 코돈 시퀀스의 통계적 구조에 더 적합함을 보여줍니다.
  2. 영어 텍스트에 대한 사전학습은 성능을 저하시킵니다 – ModernBERT를 영어 체크포인트로 초기화하면 코돈 패턴 학습 능력이 감소합니다.
  3. 하이퍼파라미터 튜닝이 규모보다 더 중요합니다 – v2 체크포인트(lr 5e‑5, warm‑up 2 k steps)는 당혹도가 약간 높음에도 CAI 상관계수를 16배 개선했습니다.
  4. 92 M 파라미터의 베이스 모델은 실용적인 저비용 대안이며, 파라미터가 1/3에 불과하면서도 대형 모델과 동등한 당혹도를 제공합니다.

3. 엔드‑투‑엔드 파이프라인

3.1 ESMFold를 이용한 단백질 접힘

  • 도구: Meta의 ESMFold v1 (단일 시퀀스, MSA 없음).
  • 성능: 30개의 PDB 체인에 대해 평균 PTM = 0.79, 잔기당 pLDDT ≈ 34 (다중 체인 대상에서는 낮음). 접힘은 A100 기준 단백질당 10–30 s가 소요됩니다.

3.2 ProteinMPNN을 이용한 서열 설계

  • 도구: ProteinMPNN (그래프 기반 역접힘).
  • 결과: 스캐폴드 7K00에 대해 세 개의 서열을 생성했으며, 온도 0.1에서 최상의 서열이 원래 아미노산의 42 %를 회수했습니다.

3.3 CodonRoBERTa를 이용한 mRNA 최적화

  • 문제 – 전통적인 CAI 테이블은 각 코돈을 독립적으로 교체하여 문맥을 무시하고 반복적이며 때때로 최적이 아닌 서열을 만들게 됩니다.
  • 해결책 – 코돈 토큰에 대한 마스크드 언어 모델링(MLM)을 적용해 문맥적 코돈 선호도를 학습합니다. 모델은 주변 문맥을 이용해 마스크된 코돈을 예측함으로써 장거리 의존성을 포착합니다.
  • 평가 지표
    • 당혹도 – CodonRoBERTa‑large‑v2의 경우 4.10 (마스크당 약 4개의 동등하게 가능한 코돈).
    • CAI 스피어만 상관계수 – 0.404 (p < 10⁻²⁰), 생물학적으로 선호되는 코돈 사용과 강하게 일치함을 나타냅니다.
    • 동의어 회복 – Top‑1 동의어 예측 12.1 %, 모델이 아미노산 제약을 잘 유지함을 보여줍니다.
  • 사용 예시 (Python, Hugging Face Transformers):
    from transformers import RobertaForMaskedLM
    model = RobertaForMaskedLM.from_pretrained("OpenMed/CodonRoBERTa-large-v2")
    tokenizer = CodonTokenizer()  # 69‑token codon vocab
    seq = "ATG GCT AAA GGT ..."
    inputs = tokenizer(seq, return_tensors="pt")
    with torch.no_grad():
        scores = model(**inputs).logits
    

4. 25 종으로 확장 – 모든 유기체를 아는 단일 모델

4.1 데이터 엔지니어링

  • 25종(19 박테리아, 3 효모, 3 포유류)의 RefSeq CDS를 다운로드했습니다.
  • 검증 단계: 시작/종료 코돈, 길이 % 3 = 0, 내부 정지코돈 없음.
  • 최종 데이터셋: 381 283 시퀀스 (≈ 3 GB), 종별 95 %/5 % 훈련/테스트로 분할했습니다.

4.2 종‑조건 토크나이저

  • 69‑토큰 코돈 어휘에 25개의 특수 종 토큰을 추가해 94‑토큰 어휘를 만들었습니다.
  • 각 시퀀스는 해당 종 토큰(예: [HUMAN])으로 앞에 붙이며, 이를 통해 모델은 파라미터를 공유하면서도 종별 코돈 편향을 학습합니다.

4.3 범용 베이스 모델

  • 아키텍처: RoBERTa‑large (311.9 M 파라미터) + 94‑토큰 어휘.
  • 훈련: 4 × A100 GPU에서 48 h, 50 k 스텝(≈ 4.5 epoch), bf16 혼합 정밀도, Fully Sharded Data Parallel (FSDP).
  • 테스트 당혹도: 24.9 – 단일 종 모델보다 높으며, 25개의 서로 다른 코돈 사용 패턴을 모두 포착해야 하기 때문입니다.

4.4 종‑특화 미세조정

훈련 시퀀스 미세조정 단계 GPU‑시간 테스트 당혹도
Human (치료용 mRNA) 131 k 15 k 4 h 24.3
E. coli (박테리아 발현) 8.5 k 5 k 0.5 h 25.3
CHO (생물제약 포유류) 42.5 k 10 k 2.5 h 25.5

Human 전문 모델은 파라미터를 훨씬 적게 사용하면서도 범용 베이스보다 2.4 % 낮은 당혹도를 보여, 다종 기반 전이학습의 이점을 확인시켜 줍니다.

4.5 모델 스위트 (Hugging Face에 공개)

  • OpenMed/CodonRoBERTa-large-multispecies – 311 M 파라미터의 범용 모델.
  • OpenMed/CodonRoBERTa-large-human – 인간 세포용 전문 모델(전체 성능 최고).
  • OpenMed/CodonRoBERTa-large-ecoliE. coli 전용 전문 모델.
  • OpenMed/CodonRoBERTa-large-cho – CHO 세포용 전문 모델.
  • OpenMed/CodonRoBERTa-large-v2 – 가장 낮은 당혹도(4.10)와 최고 CAI 상관계수(0.404)를 기록한 E. coli 단일 종 모델.
  • OpenMed/CodonRoBERTa-base – 92 M 파라미터의 효율적인 대안.

모든 모델은 Apache‑2.0 라이선스를 따르며, safetensors 형식으로 저장되고 from_pretrained() 로 로드할 수 있습니다.

5. 엔드‑투‑엔드 워크플로우 예시

  1. Fold – ESMFold를 사용해 목표 단백질의 3‑D 구조를 얻습니다.
  2. Design – 기능성 잔기를 고정한 채 ProteinMPNN을 실행해 후보 아미노산 서열을 생성합니다.
  3. Validate – 후보들을 ESMFold로 다시 접힘시켜 pLDDT/PTM이 높은 것만 유지합니다.
  4. Optimize – 선택된 아미노산 서열을 적절한 CodonRoBERTa 전문 모델(예: CodonRoBERTa-large-human)에 전달해 코돈 최적화 DNA 문자열을 얻습니다.
  5. Synthesize – DNA를 주문·클론하고 선택된 숙주에서 발현을 테스트합니다.

전체 계산 루프는 일반적인 단백질에 대해 단일 GPU에서 1시간 미만에 실행되며, 과거에 수주가 걸리던 습관적 실험 과정을 크게 단축합니다.

6. 현황 및 향후 방향

6.1 최신 모델과 비교

모델 파라미터 데이터 크기 종 조건 보고된 CAI / 번역 효율성 지표
OpenMed CodonRoBERTa 312 M 381 k CDS (25 species) 25 토큰을 사용한 단일 모델 CAI 스피어만 0.404 (human specialist)
mRNABERT (Xiong et al., 2025) 86 M 18 M 시퀀스 종 토큰 없음 R² 0.66 on translation efficiency
NUWA (Zhong et al., 2026) 115 M 시퀀스, ~25 k species 세 개의 도메인‑특화 모델 11/13 벤치마크에서 CodonBERT 능가

OpenMed의 독특한 기여

  • 단일, 종‑조건 모델 – 25종을 모두 포괄하는 하나의 모델로, NUWA의 세 개 도메인‑특화 모델과 달리 별도 모델이 필요 없습니다.
  • 전이학습 입증 – 범용 베이스를 8.5 k E. coli CDS에 미세조정하면 전문 모델이 베이스보다 우수함을 보여줍니다.
  • 완전하고 실행 가능한 파이프라인 제공 – 접힘 → 설계 → 코돈 최적화까지 모든 코드와 가중치를 관용적인 라이선스로 공개합니다.

6.2 진행 중인 연구 – CodonJEPA

  • 목표 – 토큰‑레벨 MLM을 Joint Embedding Predictive Architecture(JEPA)로 교체해 동의어 코돈을 임베딩 공간에서 구분되지 않게 합니다.
  • 초기 결과 (15 k 스텝, 동일 데이터):
    • 동의어 견고성(코사인 유사도) = 0.9997 (JEPA) vs 0.9414 (MLM).
    • 차원 붕괴 관찰(91 % 분산이 단일 컴포넌트에 집중); VICReg 정규화를 강화하는 작업 진행 중.
  • 붕괴가 해결되면 JEPA는 본질적으로 아미노산을 인식하는 코돈 임베딩을 제공할 수 있어, MLM이 제공하지 못하는 기능을 구현합니다.

6.3 로드맵 (다음 12개월)

  1. CodonRoBERTa 확장 – 공개된 36 M 시퀀스 mRNABERT 데이터셋에 대해 학습하고 ProtT5‑XL과의 대비 정렬을 추가합니다.
  2. 미세조정 확대 – 효모, 마우스, Pichia 등 추가 유기체에 대해 미세조정하고 업데이트된 전문 체크포인트를 공개합니다.
  3. CodonJEPA 최종화 – 차원 붕괴 해결, mRNABERT와 벤치마크, 파이프라인에 선택적 임베딩 레이어로 통합합니다.
  4. 파이프라인 강화 – RFdiffusion을 이용한 de‑novo 백본 생성 추가 및 발현‑안정성 예측 헤드 도입.

7. 실용적인 배포

  • Inference hardware – 16 GB 이상 VRAM을 가진 단일 A100 또는 92 M 파라미터 베이스 모델을 위한 12 GB 이상 GPU.
  • Software stack – PyTorch 2.5+, transformers ≥ 4.40, flash‑attn2 (효율적인 어텐션), FSDP (훈련).
  • Licensing – 모든 구성 요소(ESMFold, ProteinMPNN, OpenMed 모델)는 MIT 또는 Apache‑2.0 라이선스를 적용받아 상업적 사용이 가능합니다.
  • Cost – 전체 훈련 비용은 AWS 스팟 인스턴스(4 × A100, 55 GPU‑시간) 기준 약 $165였습니다.

8. 참고문헌

  • Jumper, J. et al. “Highly accurate protein structure prediction with AlphaFold.” Nature (2021).
  • Lin, Z. et al. “Evolutionary‑scale prediction of atomic‑level protein structure with a language model.” Science (2023).
  • Dauparas, J. et al. “Robust deep learning‑based protein sequence design using ProteinMPNN.” Science (2022).
  • Cheng, J. et al. “CodonBERT: a language model for codon optimization.” Nucleic Acids Research (2024).
  • Xiong, Y. et al. “mRNABERT: advancing mRNA sequence design with a universal language model and comprehensive dataset.” Nature Communications (2025).
  • Zhong, Y. et al. “Large mRNA language foundation modeling with NUWA for unified sequence perception and generation.” bioRxiv (2026).
  • Warner, B. et al. “ModernBERT: Smarter, Better, Faster, Longer.” arXiv (2024).

전체 코드, 훈련된 체크포인트 및 25‑종 CDS 데이터셋은 OpenMed 조직 아래 Hugging Face에 공개될 예정입니다.

Sources