使用 Substra 創建隱私保護的 AI

聯邦學習實現隱私保護的 AI 訓練

聯邦學習(FL)是一種去中心化的機器學習技術,允許模型在多個資料提供者之間進行訓練,而無需將資料集中於單一伺服器。與其搬移原始資料,僅傳輸產生的模型權重至各伺服器,確保敏感資訊仍保留在本地伺服器上。

此方法對於醫療保健等領域至關重要,因為資料往往分散於各學術中心與醫療機構。HIPAA 等法規保護患者隱私,可能限制資料科學家可取得的資料量。聯邦學習配合這些法規,解鎖資料孤島,提供訓練有影響力模型所需的大量資料,同時維持嚴格的安全與隱私。

去中心化訓練的好處

透過聯邦學習訓練模型相較於單一來源訓練具有多項優勢:

  • 提升的魯棒性與代表性: 透過利用來自不同來源的資料,模型變得更具代表性且更具魯棒性。
  • 降低偏見: 聯邦學習降低了因底層資料集差異(例如患者族群的人口統計分布差異或資料擷取設備與技術的差異)所造成的偏見風險。
  • 提升的泛化能力: 在多個資料來源上訓練的模型通常在實際環境中的表現優於僅在單一來源上訓練的模型。

Substra:用於生產環境的開源聯邦學習框架

Substra 是一個開源的聯邦學習框架,專為真實的生產環境設計。儘管過去十年聯邦學習已取得顯著進展,Substra 更關注於在複雜的安全環境與 IT 基礎設施中,實際部署與架構聯邦網路的可行性。

真實世界的應用與影響

Substra 已被用於促成多項重要的研究里程碑,包括:

  • 藥物發現: 在 MELLODDY 計畫中,10 家競爭的生物製藥公司透過共享全球最大規模的已知生化或細胞活性的小分子集合,協作建立更精確的預測模型。
  • 醫學研究: 此框架促成了乳癌研究的突破。

與 Hugging Face 的整合

Hugging Face 與 Substra 合作,建立了一個專屬的 Space,以示範 AI 研究在真實世界中面臨的挑戰,尤其是缺乏集中且高品質的資料。此 Space 允許使用者控制樣本的分布,並觀察使用聯邦學習訓練的模型在驗證資料上持續優於僅使用單一來源資料訓練的模型。

補充的隱私增強技術(PET)

聯邦學習是更廣泛的隱私增強技術(PET)生態系的一部分。為了打造多層次的隱私保護環境,聯邦學習可與其他技術結合,例如:

  • 安全執行環境
  • 多方計算

Sources