タンパク質を用いたディープラーニング – Hugging Face のタンパク質言語モデルとフォールディングに関するガイド
TL;DR
Hugging Face は、研究者が事前学習済みタンパク質言語モデル(例:ESM‑2、ProtBERT)をファインチューニングし、ESMFold フォールディングモデルを実行できるノートブックのセットを公開しました。これにより、テキストで使用されるのと同じ転移学習パイプラインをタンパク質配列の分類、トークン分類、構造予測に適用できることが実証されました。
生物学者向けイントロダクション: 言語モデルとは何か
言語モデルは、大規模なテキストコーパスで学習し、言語の統計的構造を捉えるニューラルネットワークです。豊富なデータで事前学習し、続いて小規模な下流タスクでファインチューニングすることで、モデルは学習した知識を転移させ、タスク固有のデータ量を大幅に削減します。この概念は ULMFiT や BERT といった最新の NLP ブレークスルーの基礎であり、タンパク質に特化したモデルの土台となっています。
「転移学習は、トレーニングデータを 100 倍以上増やした場合と同等の性能をもたらす」 – ブログで引用された ULMFiT 論文からの図示。
機械学習実務者向けイントロダクション: タンパク質とは何か
タンパク質はアミノ酸の直鎖で、各アミノ酸は 1 文字(標準 20 種類のシンボル)で表されます。アルファベットは小さいものの、組み合わせの可能性により膨大な構造と機能の多様性が生まれます。文と同様に、タンパク質配列は長距離依存性を示し、残基の三次元折りたたみは遠く離れた残基に依存することが多く、自己注意機構が特に適しています。
タンパク質に対する転移学習
テキストで使用される事前学習→ファインチューニングのワークフローをタンパク質にも適用できます。
- 事前学習: 大規模なタンパク質配列データベース(例:UniProt)上でトランスフォーマーを学習させ、一般的な生化学的パターンを習得させます。
- ファインチューニング: 得られたモデルを特定の下流タスクに適用します。例としては:
- 配列分類(例:細胞内局在)
- トークン分類(例:翻訳後修飾部位の予測)
- 構造予測(タンパク質フォールディング)
事前学習済みモデルはすでにタンパク質レベルの知識をエンコードしているため、下流タスクでははるかに少ないラベル付きサンプルで済みます。
ESMFold を用いたタンパク質フォールディング
ESMFold は、AlphaFold2 に似たトランスフォーマーベースのフォールディングモデルを外部データベース検索なしで実装した Hugging Face の実装です。アミノ酸文字列(例:MLKNV…)を入力すると、直接 3 次元構造と信頼度スコアを出力します。GPU 上で高速に動作し、数秒で高品質な予測を生成でき、同種二量体 P. multocida のグルコサミン‑6‑リン酸デアミナーゼの例で示されています。
実用的リソース
- ファインチューニングノートブック(PyTorch と TensorFlow): ESM‑2 チェックポイントを用いた配列分類とトークン分類のデモです。
- ESMFold ノートブック(PyTorch のみ): エンドツーエンドのフォールディング予測用です。
- データソース: UniProt は REST API と大量ダウンロードを提供し、大規模なタンパク質配列コレクションを取得できます。
- モデルハブ:
facebook/esm2…(最先端)やRostlab/prot_bert(初期ベンチマーク)といった事前学習チェックポイントが Hugging Face Model Hub にホストされており、チェックポイント識別子を変更するだけで切り替え可能です。
さまざまな読者向けの開始方法
- ML エンジニア向け: ファインチューニングコードは標準的な NLP スクリプトと同様で、データロードステップを自分の配列とラベルのリストに置き換えるだけです。
- 生物学者向け: ノートブックはデータロードを分離しているため、生物学的タスクの定義とラベル付き配列の提供に集中できます。
コミュニティへの影響と今後のステップ
Hugging Face は研究者に訓練済みモデルを Hub にアップロードすることを奨励しており、再現性と迅速な情報共有を可能にします。モデルはインタラクティブな Spaces で公開でき、誰でもタンパク質配列を入力すればコードを書かずに予測を得られます。このオープンソースワークフローは、計算科学者と実験生物学者の協働を加速させます。
このブログ記事は上記の定性的な記述以外に定量的なベンチマーク結果を含んでいません;すべての主張は元の Hugging Face 記事から直接引用されています。
SUMMARY: Hugging Face は、タンパク質言語モデルのファインチューニング方法と ESMFold を用いたタンパク質フォールディングの手順を示すチュートリアルシリーズを発表し、NLP の転移学習手法をタンパク質配列タスクに直接適用できることを実証しました。
TITLE: タンパク質を用いたディープラーニング – Hugging Face のタンパク質言語モデルとフォールディングに関するガイド
Sources
- OriginalDeep Learning with Proteins