使用 Substra 创建隐私保护的 AI
联邦学习实现隐私保护的 AI 训练
联邦学习(FL)是一种去中心化的机器学习技术,允许在多个数据提供方之间训练模型,而无需将数据集中到单一服务器上。与其移动原始数据,仅传输生成的模型权重到各服务器,确保敏感信息保留在本地服务器上。
这种方法对医疗等领域至关重要,因为数据常常分散在学术中心和医疗机构之间。HIPAA 等法规保护患者隐私,可能限制数据科学家可获取的数据量。联邦学习配合这些法规,打破数据孤岛,提供训练有影响力模型所需的数据量,同时保持严格的安全性和隐私性。
去中心化训练的优势
- 提升的鲁棒性和代表性: 通过利用来自不同来源的数据,模型变得更具代表性和鲁棒性。
- 降低偏差: 联邦学习降低了因底层数据集差异导致的偏差风险,例如患者群体的人口分布差异或数据采集设备和技术的差异。
- 提升的泛化能力: 在多个数据源上训练的模型通常在真实环境中的表现优于单一来源训练的模型。
Substra:用于生产环境的开源联邦学习框架
Substra 是一个为真实生产环境设计的开源联邦学习框架。尽管过去十年联邦学习取得了显著进展,Substra 侧重于在复杂安全环境和 IT 基础设施中实际部署和构建联邦网络的架构。
实际应用与影响
- 药物发现: 在 MELLODDY 项目中,10 家竞争的生物制药公司通过共享全球最大规模的已知生化或细胞活性的小分子集合,合作构建更精确的预测模型。
- 医学研究: 该框架推动了乳腺癌研究的突破。
与 Hugging Face 的集成
Hugging Face 与 Substra 合作创建了专用的 Space,以展示 AI 研究的真实挑战,特别是缺乏集中、高质量的数据。该 Space 让用户能够控制样本分布,并观察使用联邦学习训练的模型在验证数据上始终优于使用单一来源数据训练的模型。
互补的隐私增强技术(PET)
联邦学习是更广泛的隐私增强技术(PET)生态系统的一部分。为了构建多层次的隐私保护环境,联邦学习可以与以下技术结合使用:
- 安全隔离区
- 多方计算