AI for Food Allergies:生物醫學研究的開放資料集收集

Hugging Face 已宣布 AI for Food Allergies 計畫,這是一個由社群驅動的研究倡議,旨在彌合人工智慧與生物醫學科學之間的鴻溝,以提升對食物過敏的理解、預測與治療。該計畫的主要成果是發布 Awesome Food Allergy Datasets,這是首個開放且精心註釋的資料集集合,分類用於支援過敏原性、臨床免疫學與法規食品安全之 AI 研究。

AI 與食物過敏研究的交叉點

人工智慧正透過超越簡單序列比對的深度學習模型,改變食物過敏研究的方式,使其能預測免疫反應。當前最先進的應用包括:

  • 分子預測: 如 ProtBERT、ESM-2、AllergenBERT 等深度學習模型會分析胺基酸序列,以辨識生化模式與表位相似性。AllergenAI 等工具利用卷積神經網路發掘對 IgE 結合至關重要的基序,減少數月的實驗室實驗需求。
  • 治療藥物發現: AI 透過圖神經網路與 transformer 進行藥物‑目標互動(DTI)建模。藉由利用 DAVIS、PDBbind 等資料集,研究人員可進行虛擬篩選,以抑制 IgE–FcεRI 結合或調節發炎通路。
  • 臨床診斷: 機器學習模型結合皮膚刺試結果、血清特異性 IgE 水平與患者病史,提供可解釋的食物過敏機率,降低高風險口服食物挑戰的必要性。
  • 消費者安全: 自然語言處理(NLP)與電腦視覺(CV)被用於大規模讀取成分標籤,偵測隱藏過敏原(例如將「tahini」映射為芝麻),並即時監控 FDA/USDA 的召回資訊。

Awesome Food Allergy Datasets 收集

為了解決生物醫學資料的稀缺與碎片化問題,AI for Food Allergies 計畫策劃了一個包含三個互補層級的完整資源:

1. 蛋白質與分子過敏原層

此層讓模型能從蛋白質序列走向結構再到免疫反應。它整合了:

  • 過敏原資料庫: WHO/IUIS Allergen Nomenclature Database、AllergenOnline、AllerBase 等提供已驗證的序列與交叉反應註釋。
  • 結構與量子資料: SDAP 2.0、PDBBind+、QM9 等資源提供分子表面、結合親和力與靜電描述子,協助 AI 理解蛋白質為何與 IgE 抗體互動。
  • 藥理資料庫: 整合 DAVIS、DrugCentral、STITCH,可研究過敏原與藥物之間的交叉反應,並找出免疫調節療法。

2. 臨床、免疫與治療層

此層聚焦於人類資料,以建模致敏、耐受與治療演變:

  • 免疫學: Immune Epitope Database (IEDB) 與 AlgPred 2.0 繪製 B 細胞與 T 細胞表位以及抗體結合區域。
  • 患者結果: Food Anaphylaxis ML Dataset (TIP) 以及 HealthNuts、CHILD 等大型隊列提供基因與微生物背景。
  • 治療模擬: 為過敏原免疫治療 (AIT) 試驗所製作的模擬資料集,使研究者能在不危及患者的情況下模擬長期脫敏反應。
  • 多組學: Human Metabolome Database (HMDB) 與 GWAS 資料支援探討基因與代謝如何形塑過敏疾病。

3. 食品、成分與法規層

此層將實驗室科學與現實食品安全相連結:

  • 產品資料庫: 來自 Open Food Facts 與 FSA Allergen Database Service 的多語言資料,描述消費者產品與標示標準。
  • 不良事件追蹤: CAERS(CFSAN Adverse Event Reporting System)與政府召回來源(FDA、USDA、CFIA)追蹤未標示過敏原事件。
  • 標籤語料庫: 多語言語料庫將在地術語正規化為標準過敏原,並使用合成影像訓練視覺模型,以在真實超市環境(眩光、模糊、曲面)下讀取包裝。

存取與未來方向

此集合託管於 Hugging Face datasets repository,可透過專屬互動空間搜尋。專案透過 GitHub 倉庫維護,以鼓勵社群貢獻。

未來,計畫將從資料收集轉向實作研究專案。社群欲解決的關鍵科學問題包括:

  • 開發早期診斷工具,以在過敏發作前預測食物過敏。
  • 設計更有效的免疫治療,以達成長期耐受。
  • 透過智慧分子設計,研發低致敏性的食品。

Sources