자연의 단백질 폴드의 비합리적인 중복성

자연 단백질 폴드는 매우 중복적이다

자연 단백질 서열은 방대하지만, 그에 대응하는 3D 폴드는 놀라울 정도로 중복됩니다. MGnify와 같은 메타게놈 데이터베이스가 수십억 개의 서열을 제공하지만, Ligo Biosciences의 분석에 따르면 이러한 서열이 구조적 다양성의 비례적 증가로 이어지지는 않습니다. 대신, 대부분의 자연 단백질은 상대적으로 작은 집합의 안정적이고 발현 가능하며 적응 가능한 폴드 솔루션을 재사용합니다.

이러한 중복성은 생성형 생체분자 모델을 학습시키는 데 큰 도전을 안겨줍니다. 자연 서열을 더 많이 접어 학습 데이터를 단순히 확장하는 것은 종종 동일한 폴드 군에 속하는 많은 서열 변이를 추가하는 결과를 낳으며, 진정으로 새로운 구조적 예시를 도입하지 못합니다. 서열 다양성과 폴드 다양성 사이의 이 불일치는 "데이터를 규모 확대"하는 딥러닝 모델 개선 전략이 가능한 단백질 구조의 지식 확장을 목표로 할 때 수익이 감소할 수 있음을 의미합니다.

서열 다양성과 폴드 다양성 사이의 격차

서열 공간에서 비슷해 보이는 단백질과 폴드 공간에서 비슷한 단백질 사이에는 깊은 단절이 존재합니다. 단백질은 매우 낮은 서열 동일성을 보이면서도 거의 동일한 3D 구조를 유지할 수 있습니다.

예를 들어, 구조 클러스터 A0A242HMU2_f1에서는 세 단백질이 동일한 폴드(TM-score > 0.75)를 공유하지만, 쌍별 전역 동일성은 23.9%에서 28.3%에 불과합니다. 이는 진화가 매우 다른 아미노산 서열을 사용하면서도 동일한 구조적 해법에 도달한다는 것을 보여줍니다.

확장 가능한 클러스터링 파이프라인 구축

구조적 중복성을 정량화하기 위해 Ligo는 원시 예측 구조를 정제된, 클러스터링 가능한 조각으로 변환하는 파이프라인을 개발했습니다. 이 과정은 AlphaFold 예측에 종종 포함되는 무질서한 꼬리, 유연한 링커, 다중 도메인 단백질 등 핵심 구조 신호를 흐리게 하는 요소들을 해결하는 "예측 구조 문제"에 대응합니다.

노이즈 제거 및 조각화

파이프라인은 pLDDT가 65 이하인 잔기를 제거하여 명백한 무질서를 없이는 것으로 시작합니다. 남은 잔기는 연속적인 조각으로 분할되고, 공간적으로 접촉하는 조각은 유니온-파인드 방식으로 다시 결합됩니다. 그러나 고신뢰도 링커가 독립적인 도메인을 잘못 병합할 수 있기 때문에 보다 정교한 그래프 이론적 접근이 필요합니다.

그래프 이론 기반 스펙트럴 이분법

Ligo는 단백질을 그래프로 취급합니다. 여기서 잔기는 노드이며, 공간적으로 가장 가까운 이웃을 연결하는 에지가 존재합니다. 도메인 간 진정한 경계를 식별하기 위해 파이프라인은 정규화 그래프 라플라시안의 두 번째로 작은 고유값에 대응하는 피들러 벡터를 이용한 스펙트럴 이분법을 사용합니다.

이 방법은 공간 그래프에서 "병목"—밀집 영역을 연결하는 좁은 다리—를 찾아냅니다. 이 이분법을 재귀적으로 적용함으로써 시스템은 다중 도메인 단백질을 독립적인 상호작용 단위로 정밀하게 분할할 수 있어, 모델이 무질서한 영역이나 비정상적으로 길어진 사슬에 용량을 낭비하는 일을 방지합니다.

MGnify의 중복성 정량화

약 200만 개의 MGnify 조각을 조각화하고 필터링한 후, Ligo는 Foldseek을 이용한 구조 클러스터링과 이후 TM-align 감사를 수행하여 정확성을 확보했습니다.

폴드 분포

결과는 구조적 우주가 소수의 "핵심" 클러스터에 의해 지배된다는 것을 보여줍니다:

  • 전체 다중 멤버 클러스터: MGnify에 약 25,300개.
  • 질량 집중: 전체 MGnify 다중 멤버 조각의 71.5%가 상위 1,000개 클러스터에 존재합니다.

이 발견은 "실제" 재사용 가능한 구조적 이웃 수가 수백만 개의 클러스터가 아니라 수만 개 수준에 가깝다는 것을 시사합니다.

데이터 샘플링에 대한 함의

데이터가 이렇게 편향되어 있기 때문에, 데이터셋에서 균등 샘플링을 하면 흔한 폴드가 과대표집되고, 클러스터에서 균등 샘플링을 하면 희귀 폴드가 과대표집됩니다. Ligo는 클러스터 크기 지수 $\gamma$를 사용해 샘플링 확률을 $N^\gamma$ (여기서 $N$은 클러스터 크기)로 가중합니다. $\gamma \approx 0.5$ 값을 사용해 흔한 폴드의 우위를 유지하면서 희귀 폴드의 긴 꼬리를 평탄화합니다.

효소 설계에 미치는 영향

극단적인 구조 중복성의 발견은 효소 설계의 미래에 두 가지 뚜렷한 경로를 제시합니다:

  1. 자연 친화적 경로: 익숙한 스캐폴드의 활성 부위 주변을 정교화하는 데 집중합니다. 이 경우, 1차 껍질 잔기의 정확한 기하학과 리간드 포즈가 전체 백본의 새로움보다 더 중요합니다.
  2. 탐험적 경로: 진화가 결코 방문하지 않은 "비자연적" 백본 공간을 탐색합니다. 이는 자연 폴드 공간이 역사적 사고(중복 및 분기)에 의해 제한된 것이지 절대적인 물리적 한계에 의해 제한된 것이 아니라는 가정에 기반합니다.

커뮤니티 관점

이러한 발견에 대한 기술적 논의는 데이터의 새로움과 기존 생화학 지식 사이의 긴장을 강조합니다:

"30년 전 내 단백질 수업의 교수님이 몇 가지 중요한 점을 언급하셨습니다... 종에 따라 '같은' 단백질이 서열에서 최대 40%까지 차이날 수 있지만 구조는 동일합니다. 때로는 80%까지도 가능합니다."

다른 기여자들은 진화가 "자유로운 단백질 표절" 경향을 보이는 것이 알려진 현상이지만, 자동화된 파이프라인이 밝혀낸 중복성 규모는 메타게놈 서열 데이터베이스에 실제로 포함된 "새로운" 정보가 얼마나 적은지를 구체적인 지표로 제공한다고 지적했습니다.

Sources