Substraでプライバシー保護AIを作成する
フェデレーテッドラーニングがプライバシー保護AIトレーニングを可能にする
フェデレーテッドラーニング(FL)は、データを単一サーバーに集中させることなく、複数のデータ提供者にまたがってモデルをトレーニングできる分散型機械学習手法です。生データを移動させる代わりに、生成されたモデルの重みだけがサーバー間で転送されるため、機密情報はローカルサーバーに留まります。
このアプローチは、データが学術センターや医療機関間でサイロ化されがちなヘルスケアなどの領域で特に重要です。HIPAA のような規制は患者のプライバシーを保護し、データサイエンティストが利用できるデータ量を制限することがあります。フェデレーテッドラーニングはこれらの規制と共存し、サイロを解放してインパクトのあるモデルをトレーニングするために必要なデータ量を提供しつつ、厳格なセキュリティとプライバシーを維持します。
分散型トレーニングのメリット
- ロバスト性と表現力の向上: 異なるソースのデータを活用することで、モデルはより代表的かつロバストになります。
- バイアスの低減: FL は、患者集団の人口統計分布の違いやデータ取得機器・手法の差異など、基礎データセットのばらつきによるバイアスリスクを減らします。
- 汎化性能の改善: 複数のデータソースでトレーニングされたモデルは、単一ソースでトレーニングされたモデルに比べ、実世界の環境でより良い性能を示すことが一般的です。
Substra: プロダクションFL向けのオープンソースフレームワーク
Substra は、実際のプロダクション環境向けに設計されたオープンソースのフェデレーテッドラーニングフレームワークです。過去10年間でフェデレーテッドラーニングは大きく進展しましたが、Substra は複雑なセキュリティ環境や IT インフラストラクチャにおけるフェデレーテッドネットワークの実装とアーキテクチャに焦点を当てています。
実世界での応用とインパクト
- Drug Discovery: MELLODDY プロジェクトでは、10 社の競合バイオファーマ企業が、既知の生化学的または細胞的活性を持つ世界最大規模の小分子コレクションを共有し、より正確な予測モデルの構築に協力しました。
- Medical Research: このフレームワークは、乳がん研究における画期的な成果を実現するのに貢献しています。
Hugging Faceとの統合
Hugging Face は Substra と協力し、AI 研究の実際的な課題(特に集中化された高品質データの欠如)を示す専用 Space を作成しました。この Space では、サンプルの配布を制御し、フェデレーテッドラーニングでトレーニングされたモデルが、単一ソースのデータでトレーニングされたモデルに比べ、検証データで一貫して優れた性能を示す様子を観察できます。
補完的プライバシー強化技術(PET)
フェデレーテッドラーニングは、プライバシー強化技術(PET)の広範なエコシステムの一部です。多層的なプライバシー保護環境を構築するために、FL は以下のような他の技術と組み合わせることができます。
- Secure Enclaves
- Multi-party Computation