단백질을 활용한 딥러닝 – Hugging Face 가이드: 단백질 언어 모델 및 폴딩

TL;DR

Hugging Face는 연구자들이 사전 학습된 단백질 언어 모델(e.g., ESM‑2, ProtBERT)을 파인튜닝하고 ESMFold 폴딩 모델을 실행할 수 있는 노트북 세트를 공개했으며, 텍스트에 사용되는 동일한 전이 학습 파이프라인을 단백질 서열 분류, 토큰 분류 및 구조 예측에 적용할 수 있음을 입증했습니다.


Introduction for Biologists: What a Language Model Is

언어 모델은 방대한 텍스트 코퍼스에 대해 학습되어 언어의 통계적 구조를 파악하는 신경망입니다. 풍부한 데이터로 사전 학습한 뒤 작은 다운스트림 작업에 파인튜닝함으로써 모델은 학습된 지식을 전이시켜 작업에 필요한 데이터 양을 크게 줄입니다. 이 개념은 ULMFiT와 BERT와 같은 최신 NLP 혁신의 기반이며, 단백질 중심 모델의 토대가 됩니다.

"전이 학습은 훈련 데이터가 100배 이상 많은 경우와 동등한 성능을 제공한다" – 블로그에서 인용된 ULMFiT 논문의 일러스트.

Introduction for Machine‑Learning Practitioners: What a Protein Is

단백질은 아미노산의 선형 사슬이며, 각각은 하나의 문자(표준 20가지 기호)로 표시됩니다. 알파벳은 작지만 조합 가능성은 방대한 구조와 기능의 다양성을 만들어냅니다. 문장과 마찬가지로 단백질 서열은 장거리 의존성을 보이며, 잔기의 3차원 폴드는 종종 먼 잔기에 의존합니다. 이러한 특성 때문에 self‑attention 메커니즘이 특히 적합합니다.

Transfer Learning for Proteins

The same pre‑training‑then‑fine‑tuning workflow used for text can be applied to proteins:

  1. Pre‑train 트랜스포머를 방대한 단백질 서열 데이터베이스(e.g., UniProt)에서 학습시켜 일반적인 생화학적 패턴을 학습합니다.
  2. Fine‑tune 결과 모델을 다음과 같은 특정 다운스트림 작업에 적용합니다:
    • Sequence classification (e.g., subcellular localization).
    • Token classification (e.g., predicting post‑translational modification sites).
    • Structure prediction (protein folding). 사전 학습된 모델이 이미 단백질 수준의 지식을 내포하고 있기 때문에, 다운스트림 작업은 훨씬 적은 라벨된 예시만 필요합니다.

Protein Folding with ESMFold

ESMFold는 AlphaFold2와 유사하지만 외부 데이터베이스 검색 없이 동작하는 트랜스포머 기반 폴딩 모델에 대한 Hugging Face의 구현입니다. 아미노산 문자열(e.g., MLKNV…)을 입력받아 3‑D 구조와 신뢰도 점수를 직접 출력합니다. 이 모델은 GPU에서 빠르게 실행되며, 동형 이합체 P. multocida 글루코사민‑6‑인산 탈아미노효소 예시와 같이 몇 초 만에 고품질 예측을 생성할 수 있습니다.

Practical Resources

  • Fine‑tuning notebooks (PyTorch & TensorFlow) 은 ESM‑2 체크포인트를 사용한 서열 및 토큰 분류를 시연합니다.
  • ESMFold notebook (PyTorch only) 은 엔드‑투‑엔드 폴딩 예측을 위한 노트북입니다.
  • Data sources: UniProt은 대규모 단백질 서열 컬렉션을 위한 REST API와 대량 다운로드를 제공합니다.
  • Model hubs: Pre‑trained checkpoints such as facebook/esm2… (state‑of‑the‑art) and Rostlab/prot_bert (early benchmark) are hosted on the Hugging Face Model Hub and can be swapped by changing the checkpoint identifier.

Getting Started for Different Audiences

  • For ML engineers: 파인튜닝 코드는 표준 NLP 스크립트를 그대로 따르며, 데이터 로딩 단계를 자신의 서열 및 라벨 리스트로 교체하면 됩니다.
  • For biologists: 노트북은 데이터 로딩을 분리하여, 생물학적 작업 정의와 라벨된 서열 제공에 집중할 수 있게 합니다.

Community Impact and Next Steps

Hugging Face는 연구자들이 학습된 모델을 Hub에 업로드하도록 장려하여 재현성과 빠른 확산을 가능하게 합니다. 모델은 인터랙티브 Spaces에 전시될 수 있어, 누구든지 단백질 서열을 입력하고 코드를 작성하지 않아도 예측을 받을 수 있습니다. 이 오픈‑소스 워크플로우는 계산 과학자와 실험 생물학자 간의 협업을 가속화합니다.


The blog post does not contain quantitative benchmark results beyond the qualitative statements above; all claims are directly taken from the original Hugging Face article.

Sources