自然蛋白質摺疊的非理性冗餘
自然蛋白質摺疊具有高度冗餘性
自然蛋白質序列非常龐大,但其產生的 3D 摺疊比序列數量所暗示的更具冗餘性。對 MGnify 規模數據的分析顯示,大部分的結構質量集中在少數幾個結構鄰域中,這意味著單純增加用於訓練生成模型的自然序列數據量,並不會線性地增加訓練集的結構多樣性。
序列與摺疊多樣性之間的失配
雖然理論上的蛋白質序列空間是巨大的(對於長度為 N 的蛋白質,空間大小為 20^N),但自然蛋白質僅佔據該空間中極小且具結構性的部分。演化經常重複使用穩定、可表達且具適應性的摺疊。這造成了一種情境:蛋白質在序列一致性方面可能高度分歧,但在 3D 摺疊方面卻幾乎相同。
例如,在 Ligo 的 AFDB 碎片簇中,某些蛋白質的序列一致性低至 23.9–28.3%,但仍維持 TM-score > 0.75,這表明儘管序列存在顯著分歧,它們仍共享相同的摺疊。
預測結構的聚類挑戰
對預測結構(例如來自 AlphaFold 的結構)進行聚類比對實驗晶體進行聚類更為複雜,因為預測的鏈通常包含無序尾部、鬆散的連接器(floppy linkers)以及不代表功能性摺疊單元的信號肽。
圖譜譜分法解決方案
為了分離出有意義的結構單元,Ligo 實施了一套基於圖論的分割流程:
- 噪聲移除:移除 pLDDT 低於 65 的殘基。
- 圖構建:將蛋白質視為一個圖,其中殘基是節點,邊連接最近的 15 個空間鄰居。
- 譜分法(Spectral Bisection):使用 Fiedler vector(對應於歸一化圖拉普拉斯矩陣第二小特徵值的特徵向量),系統可以識別圖中最強的全局連接。
- 遞歸切割:該過程會重複進行,直到分割出的部分在內部是連接良好的(由 $\lambda_2$ 閾值定義),從而有效地將緊湊的結構域(domains)與高置信度的連接器分離出來。
大規模量化結構冗餘
通過將此碎片化與聚類流程應用於 MGnify 數據,Ligo 發現結構的新穎性遠低於先前報告的水平。雖然一些快速聚類方法(如 Foldseek)可能會報告數百萬個非單一元素簇(non-singleton clusters),但使用 TM-align 進行更嚴格的審計會發現,許多「單一元素簇」實際上共享相同的摺疊。
MGnify 分析的關鍵發現
在進行序列聚類、碎片化與質量過濾後,對 196 萬個 MGnify 碎片進行的分布情況顯示:
- 有限的結構鄰域:大約有 25,300 個多成員結構簇。
- 重尾分布:前 1,000 個簇包含了多成員簇中所有碎片的 71.5%,儘管它們僅佔總簇列表的 4%。
這表明,從自然序列數據庫中進行均勻採樣,大多只會重新訪問相同的常見結構鄰域。
對生成式酶設計的啟示
自然摺疊的高冗餘性暗示了酶設計未來的兩條不同路徑:
- 類自然路徑:專注於使用熟悉的支架(scaffolds)以高精度工程化活性位點鄰域。在此模式下,全球骨架新穎性不如第一層殘基與配體的局部交互作用幾何結構重要。
- 推測性路徑:探索「非自然」骨架空間。由於演化在歷史上受到重複與分歧的限制,可能存在自然界從未探索過的具有功能性的摺疊。挑戰在於確定模型是否能從自然數據訓練並泛化到這些未探索的流形(manifolds)。
社群觀點與技術反駁點
圍繞這些發現的技術討論突顯了計算發現與既有生化知識之間的分歧:
- 生化共識:一些專家認為這種冗餘性在生化領域是廣為人知的,並指出蛋白質可以有 40–80% 的序列分歧,但仍維持相同的結構。
- 演化約束:評論者指出,演化優先考慮能量有利且穩健的模式,實際上是在「剽竊」成功的結構解決方案。
- 模型局限性:批評者指出,基於 AlphaFold 的方法受限於訓練數據對現有實驗結構的依賴,這可能使模型對 20 種標準氨基酸的所有物理可能性視而不見。
"演化在不同層次發現了一堆結構模式……它們在能量上是有利的、多功能的、易於摺疊的、對突變具有穩健性,然後就一直重複使用它們。"
"這篇論文的發現對於研究蛋白質的人來說並不意外。"
冗餘數據的採樣策略
為了防止生成模型被最常見的摺疊所淹沒,同時避免過度代表稀有摺疊,Ligo 利用了一個平衡指數 $\gamma$(cluster_size_exponent)。採樣概率隨 $N^\gamma$ 進行縮放(其中 $N$ 是簇的大小)。
- $\gamma = 1$:恢復自然數據集的分布。
- $\gamma = 0$:對每個簇進行等權重處理。
- $\gamma = 0.5$:一種平衡的方法,在保留分布「頭部」主導地位的同時,壓平長尾部分,從而增加有效的簇數量。