Substra를 활용한 프라이버시 보호 AI 만들기

연합 학습으로 프라이버시 보호 AI 훈련 가능

연합 학습(Federated Learning, FL)은 데이터를 단일 서버에 중앙 집중화할 필요 없이 여러 데이터 제공자에 걸쳐 모델을 훈련시킬 수 있는 분산 머신러닝 기법입니다. 원시 데이터를 이동시키는 대신, 결과 모델 가중치만 서버 간에 전송되어 민감한 정보가 로컬 서버에 남도록 보장합니다.

이 접근 방식은 데이터가 학술 센터와 의료 기관에 걸쳐 사일로화되는 경우가 많은 의료 분야와 같이 중요한 분야에서 필수적입니다. HIPAA와 같은 규제는 환자 프라이버시를 보호하며, 이는 데이터 과학자가 활용할 수 있는 데이터 양을 제한할 수 있습니다. 연합 학습은 이러한 규제와 함께 작동하여 이러한 사일로를 해제하고, 엄격한 보안 및 프라이버시를 유지하면서 영향력 있는 모델을 훈련시키는 데 필요한 데이터 양을 제공합니다.

분산 훈련의 장점

  • 향상된 견고성 및 대표성: 다양한 출처의 데이터를 활용함으로써 모델이 보다 대표적이고 견고해집니다.
  • 편향 감소: 연합 학습은 환자 집단의 인구통계 분포 차이나 데이터 수집 장비 및 기술의 차이와 같은 기본 데이터셋의 변동으로 인한 편향 위험을 감소시킵니다.
  • 일반화 향상: 여러 데이터 소스에서 훈련된 모델은 단일 소스에서 훈련된 모델보다 실제 환경에서 더 좋은 성능을 보이는 경우가 많습니다.

Substra: 프로덕션 연합 학습을 위한 오픈 소스 프레임워크

Substra는 실제 프로덕션 환경을 위해 설계된 오픈 소스 연합 학습 프레임워크입니다. 연합 학습은 지난 10년간 크게 발전했지만, Substra는 복잡한 보안 환경 및 IT 인프라에서 연합 네트워크의 실용적인 배포와 아키텍처에 중점을 둡니다.

실제 적용 사례 및 영향

  • 신약 발견: MELLODDY 프로젝트에서 10개의 경쟁 바이오제약 기업이 알려진 생화학적 또는 세포 활동을 가진 세계 최대 규모의 소분자 컬렉션을 공유하여 보다 정확한 예측 모델을 구축했습니다.
  • 의료 연구: 이 프레임워크는 유방암 연구에서 획기적인 성과를 가능하게 했습니다.

Hugging Face와의 통합

Hugging Face는 Substra와 협력하여 AI 연구의 실제 과제, 특히 중앙 집중식 고품질 데이터의 부족을 보여주는 전용 Space를 만들었습니다. 이 Space를 통해 사용자는 샘플 배포를 제어하고, 연합 학습으로 훈련된 모델이 검증 데이터에서 단일 소스 데이터로 훈련된 모델보다 일관되게 우수한 성능을 보이는 것을 관찰할 수 있습니다.

보완적인 프라이버시 강화 기술(PETs)

연합 학습은 프라이버시 강화 기술(PETs)의 광범위한 생태계의 일부입니다. 다층 프라이버시 보호 환경을 만들기 위해 연합 학습은 다음과 같은 다른 기술과 결합될 수 있습니다:

  • 보안 엔클레이브
  • 다당사자 계산

Sources