自然蛋白质折叠的非理性冗余

自然蛋白质折叠具有高度冗余性

自然蛋白质序列极其庞大,但其产生的 3D 折叠比序列数量所暗示的要冗余得多。对 MGnify 规模数据的分析表明,大部分结构质量集中在少量的结构邻域中,这意味着仅仅通过增加用于训练生成模型的自然序列数据的量,并不能线性地增加训练集的结构多样性。

序列与折叠多样性之间的不匹配

虽然理论上的蛋白质序列空间是巨大的(对于长度为 N 的蛋白质,空间大小为 20^N),但自然蛋白质仅占据该空间中极小且具有结构的比例。进化过程经常重复使用那些稳定、可表达且具有适应性的折叠方式。这导致了一种情况:蛋白质在序列一致性上可能高度分化,但在 3D 折叠上却几乎相同。

例如,在 Ligo 的 AFDB 片段聚类中,一些蛋白质的序列一致性低至 23.9–28.3%,但仍保持 TM-score > 0.75,这表明尽管序列存在显著差异,它们仍共享相同的折叠方式。

预测结构的聚类挑战

对预测结构(例如来自 AlphaFold 的结构)进行聚类比对实验晶体结构进行聚类更为复杂,因为预测的链通常包含无序尾部、松散的连接子(linkers)以及不代表功能折叠单元的信号肽。

谱二分法解决方案

为了分离出有意义的结构单元,Ligo 实施了一种基于图论的拆分流程:

  1. 噪声移除:移除 pLDDT 低于 65 的残基。
  2. 图构建:将蛋白质视为一个图,其中残基是节点,边连接最近的 15 个空间邻居。
  3. 谱二分法:使用 Fiedler 向量(对应于归一化图拉普拉斯矩阵的第二小特征值的特征向量),系统可以识别图中连接最弱的全局连接。
  4. 递归切割:该过程不断重复,直到分区在内部是连接良好的(由 $\lambda_2$ 阈值定义),从而有效地将紧凑的结构域(domains)从高置信度的连接子中分离出来。

大规模量化结构冗余

通过将这种碎片化和聚类流程应用于 MGnify 数据,Ligo 发现结构新颖性远低于之前的报告。虽然一些快速聚类方法(如 Foldseek)可能会报告数百万个非单体聚类,但使用 TM-align 进行更严格的审计发现,许多“单体”实际上共享相同的折叠方式。

MGnify 分析的关键发现

在经过序列聚类、碎片化和质量过滤后,对 1.96 百万个 MGnify 片段的分布分析显示:

  • 有限的结构邻域:大约存在 25,300 个多成员结构聚类。
  • 重尾分布:尽管仅代表总聚类列表的 4%,但前 1,000 个聚类包含了多成员聚类中所有片段的 71.5%。

这表明,从自然序列数据库中进行均匀采样,结果大多只是在重复访问相同的常见结构邻域。

对生成式酶设计的影响

自然折叠的高冗余性为酶设计的未来指明了两个不同的路径:

  1. 类自然路径:利用熟悉的支架(scaffolds)以高精度工程化活性位点邻域。在这种模式下,全局骨架新颖性并不如第一层残基和配体(ligands)的局部相互作用几何结构重要。
  2. 推测性路径:探索“非自然”骨架空间。由于进化在历史上受到重复和分化的约束,可能存在自然界从未探索过的功能性折叠方式。挑战在于确定训练在自然数据上的模型是否能够泛化到这些未探索的流形(manifolds)。

社区观点与技术反驳

围绕这些发现的讨论突出了计算发现与既定生化知识之间的分歧:

  • 生化共识:一些专家认为这种冗余性在生化领域是众所周知的,并指出蛋白质可以序列分化 40–80%,而保持相同的结构。

  • 进化约束:评论者指出,进化优先考虑能量上有利且稳健的模式,从而有效地“剽窃”成功的结构解决方案。

  • 模型局限性:批评者指出,基于 AlphaFold 的方法受限于训练数据对现有实验结构的依赖,可能导致模型无法察觉到 20 种标准氨基酸所具备的完整物理可能性。

"进化在不同层面上发现了一系列结构模式……它们在能量上是有利的、多功能的、易于折叠、对突变具有稳健性,然后不断地重复使用它们。"

"对于研究蛋白质的人来说,这些发现并不令人惊讶。"

冗余数据的采样策略

为了防止生成式模型被最常见的折叠方式所淹没,同时避免过度代表稀有折叠,Ligo 利用了一个平衡指数 $\gamma$ (cluster_size_exponent)。采样概率随 $N^\gamma$ 缩放(其中 $N$ 是聚类大小)。

  • $\gamma = 1$:恢复自然数据集的分布。
  • $\gamma = 0$:权重分配给每个聚类是均等的。
  • $\gamma = 0.5$:一种平衡的方法,在保留分布“头部”主导地位的同时平滑了长尾部分,从而增加了有效的聚类数量。

Sources