自然のタンパク質フォールドの不合理な冗長性
自然のタンパク質フォールドは高度に冗長である
自然のタンパク質配列は膨大ですが、対応する3次元フォールドは驚くほど冗長です。MGnify のようなメタゲノムデータベースが数十億の配列を提供している一方で、Ligo Biosciences の分析は、これらが構造多様性の比例した増加につながっていないことを示しています。むしろ、自然タンパク質の大多数は、比較的少数の安定で発現可能かつ適応性のあるフォールド解決策を再利用しています。
この冗長性は、生成的バイオ分子モデルの訓練において重大な課題を生み出します。単に自然配列をより多く折りたたんで訓練データを拡大しても、同じフォールドファミリーの多数の配列バリアントが追加されるだけで、真に新しい構造例が導入されるわけではありません。配列多様性とフォールド多様性の不一致は、深層学習モデルを改善するための「データを拡大する」レシピが、可能なタンパク質構造に関するモデルの知識を拡張することを目的とした場合、効果が減少する可能性があることを意味します。
配列多様性とフォールド多様性のギャップ
配列空間での類似性とフォールド空間での類似性の間には、深い乖離があります。タンパク質は、非常に低い配列同一性を示しながら、ほぼ同一の3次元構造を維持することができます。
例えば、構造クラスター A0A242HMU2_f1 では、3つのタンパク質が同じフォールド(TM-score > 0.75)を共有していますが、対になるグローバル同一性は 23.9% から 28.3% と非常に低いです。これは、進化が大きく異なるアミノ酸配列を用いても同じ構造的解決策に頻繁に到達することを示しています。
スケーラブルなクラスタリングパイプラインの構築
構造的冗長性を定量化するために、Ligo は生の予測構造をクリーンでクラスタリング可能なフラグメントに変換するパイプラインを開発しました。このプロセスは、AlphaFold の予測がしばしば無秩序なテールや柔軟なリンカー、コア構造シグナルを隠す多ドメインタンパク質を含む「予測構造問題」に対処します。
ノイズ除去とフラグメンテーション
パイプラインは、pLDDT が 65 未満の残基を除去して明らかな無秩序を排除することから始まります。残りの残基は連続したフラグメントに分割され、空間的に接触するフラグメントは union‑find 手法で再結合されます。ただし、高信頼度のリンカーが独立したドメインを誤って結合してしまう可能性があるため、より洗練されたグラフ理論的アプローチが必要です。
グラフ理論的スペクトラル二分割
Ligo はタンパク質を、残基がノード、空間的に最も近い隣接体がエッジで結ばれるグラフとして扱います。ドメイン間の真の境界を特定するために、パイプラインは正規化グラフラプラシアンの第2小固有値に対応する固有ベクトル(Fiedler ベクトル)に基づくスペクトラル二分割を使用します。
この手法は、空間グラフにおける「ボトルネック」―密集領域をつなぐ狭い橋―を特定します。この二分割を再帰的に適用することで、システムは多ドメインタンパク質を独立した相互作用ユニットに外科的に分割でき、モデルが無秩序領域や奇怪で細長い鎖に容量を浪費するのを防ぎます。
MGnify の冗長性の定量化
約200 万の MGnify フラグメントをフラグメンテーションおよびフィルタリングした後、Ligo は Foldseek を用いた構造クラスタリングと、精度を確保するための TM-align 監査を実施しました。
フォールドの分布
結果は、構造宇宙が少数の「ヘッド」的な共通クラスターに支配されていることを示しています:
- 総マルチメンバークラスター数: MGnify では約 25,300。
- 質量の集中度: すべての MGnify マルチメンバーフラグメントの 71.5% が上位 1,000 クラスターに存在します。
この発見は、再利用可能な構造的近傍の「実際の」数は、より高速で厳密さに欠けるクラスタリング手法が報告する数百万のクラスターではなく、数万に近いことを示唆しています。
データサンプリングへの影響
データが極端に偏っているため、データセット全体からの均一サンプリングは共通フォールドを過剰に表現し、クラスターからの均一サンプリングは稀なフォールドを過剰に表現します。Ligo はバランシング指数 $\gamma$(クラスターサイズ指数)を用いて、サンプリング確率を $N^\gamma$($N$ はクラスターサイズ)で重み付けします。$\gamma \approx 0.5$ の値を使用することで、共通フォールドの支配的な位置を保ちつつ、稀なフォールドの長いテールを平坦化します。
酵素設計への影響
極端な構造冗長性の発見は、酵素設計の将来に向けて二つの異なる道筋を示唆します:
- 自然に近いルート: 既知のスキャフォールドの活性部位近傍の洗練に焦点を当てます。この領域では、第一殻残基とリガンド姿勢の正確な幾何学が、全体的なバックボーンの新規性よりも重要です。
- 投機的ルート: 進化が一度も踏み込んだことのない「非自然」なバックボーン空間を探ります。これは、自然のフォールド空間が絶対的な物理的制限ではなく、歴史的な偶然(重複と分岐)によって制約されていると仮定します。
コミュニティの視点
これらの発見に関する技術的議論は、データの新規性と生化学の確立された知識との間に緊張関係があることを浮き彫りにします:
「30 年前、私のタンパク質の授業の教授がいくつかの重要な点を指摘しました… 種間で「同じ」タンパク質は配列が最大 40% まで変化しても同じ構造を保ちます。時には 80% まで変化することもあります。」
他の貢献者は、進化が「寛大なタンパク質盗作」傾向を示すことは既知の現象であると指摘しましたが、これらの自動化パイプラインが明らかにした冗長性の規模は、メタゲノム配列データベースに実際にどれだけの「新しい」情報が含まれているかを示す具体的な指標を提供します。