臨床 ML 模型中「滑稽地糟糕」數據集的危險性

人工智慧在醫療保健領域的整合充滿前景,但其基礎完全取決於用於訓練的數據。Retraction Watch 最近的一份報告揭示了一個令人震驚的現實:幾個旨在預測中風和糖尿病的臨床模型,其訓練數據集被描述為「滑稽地糟糕」。

這種失敗並非單一模型架構的失敗,而是源於同一個根本缺陷:訓練數據。當臨床模型建立在來自 Kaggle 等平台的合成數據或策劃不佳的數據集上時,產生的預測不僅不準確,而且可能具有危險性。

Kaggle 數據集危機

根據報告,研究人員一直利用 Kaggle 上公開可用的數據集來訓練用於高風險臨床結果的模型。雖然 Kaggle 是學習和教育用途的極佳工具,但這些數據集通常沒有經過醫療診斷工具所需的臨床嚴謹性策劃。

在許多情況下,這些數據集包含異常值、合成數據點或邏輯不一致之處,對於醫療專業人員來說,這些都會是立即的警訊。然而,由於這些數據集易於取得且方便,它們已成為那些優先考慮模型建立而非數據驗證的研究人員的捷徑。

數據品質 vs. 模型架構

在圍繞這些失敗的近期討論中,一個反覆出現的主題是:誤以為機器學習 (ML) 的主要挑戰在於模型本身。許多研究人員將模型視為方程式中複雜的部分,並將模型在測試集上的性能指標視為成功的證明。

正如 Hacker News 社群成員所指出的,現實是模型通常是整個過程中容易的部分。真正的工程挑戰在於數據的收集和策劃。

"對於許多研究人員來說,他們認為自己的工作是建立模型。他們不想收集自己的數據,所以他們去 Kaggle 上找任何他們能找到的數據集... 這完全本末倒置。模型是容易的部分。獲取好的數據佔了工作的 99%。」

當研究人員依賴「黑箱」數據集而未對樣本進行嚴格審計時,他們冒著建立模型的風險,使模型從噪聲或合成偽影中學習模式,而非從實際的疾病生物標記中學習。

手動審計的必要性

為了避免這些「滑稽地糟糕」的結果,業界必須轉向更嚴謹的數據驗證方法。僅僅檢查數據集中幾打隨機樣本的簡單行為,通常就能揭示系統性問題,而這些問題對於模型的損失函數 (loss function) 來說可能是隱形的。

"數據集品質是機器學習 (ML) 在一般情況下的重大問題。你通常可以從任何給定的數據集中列出幾打隨機樣本,然後你會立即發現有些奇怪的事情正在發生。"

對於臨床 ML 而言,這是一項關鍵的必要性。任何用於醫療預測的數據集都必須經過臨床合理性驗證、經過合成數據污染審計,並源自具有清晰來源的經過驗證的醫療記錄。

結論

在臨床模型中使用低品質數據集,為 AI 領域的其他部分敲響了警鐘。無論是中風預測還是糖尿病管理,目標並非僅僅是數學優化;而是現實世界醫療知識的應用。當數據是基礎,而該基礎是有缺陷的,產生的模型——無論多麼複雜——都將是徒勞無功的嘗試。

Sources