临床 ML 模型中“滑稽般糟糕”数据集的危险性
人工智能在医疗保健领域的整合前景广阔,但其基础完全取决于用于训练的数据。Retraction Watch 最近的一份报告揭示了一个令人震惊的现实:几个旨在预测中风和糖尿病的临床模型是在被描述为“滑稽般糟糕”的数据集上训练的。
这种失败并非单一模型架构的失败,而是源于同一个根本缺陷:训练数据。当临床模型建立在来自 Kaggle 等平台的合成数据或策划不周的数据集上时,由此产生的预测不仅是不准确的,而且具有潜在的危险。
Kaggle 数据集危机
根据报告,研究人员一直在利用 Kaggle 上公开可用的数据集来训练针对高风险临床结果的模型。虽然 Kaggle 是学习和教育目的的绝佳工具,但这些数据集通常没有经过医疗诊断工具所需的临床严谨性策划。
在许多情况下,这些数据集包含异常值、合成数据点或逻辑不一致之处,对于医疗专业人员来说,这些都是立即的警示信号。然而,由于这些数据集易于获取且方便,它们已成为那些优先考虑模型构建而非数据验证的研究人员的捷径。
数据质量 vs. 模型架构
在围绕这些失败的近期讨论中,一个反复出现的主题是,认为机器学习 (ML) 的主要挑战在于模型本身的误解。许多研究人员将模型视为方程中复杂的部分,并将模型在测试集上的性能指标视为成功的证明。
正如 Hacker News 社区成员所指出的,现实是模型通常是过程中最容易的部分。真正的工程挑战在于数据的收集和策划。
"A lot of researchers think their job is to build models. They don't want to collect their own data, so they go find whatever dataset they can on Kaggle... This is backwards. The model is the easy part. Getting good data is 99% of the job."
当研究人员依赖“黑盒”数据集而没有对样本进行严格审计时,他们面临着构建学习噪声或合成伪影而非实际疾病生物学标志物的模型的风险。
手动审计的必要性
为了避免这些“滑稽般糟糕”的结果,行业必须转向更严格的数据验证方法。仅仅通过检查一个数据集中的几十个随机样本,通常就能揭示出模型损失函数原本无法察觉的系统性问题。
"Dataset quality is a huge issue in ML in general. You can often list a few dozen random samples from any given dataset and you will find out something weird going on instantly."
对于临床 ML,这是至关重要的必要性。任何用于医疗预测的数据集都必须经过临床合理性验证,审计合成数据污染,并源自具有清晰来源的已验证医疗记录。
结论
在临床模型中使用低质量数据集为 AI 领域的其他部分敲响了警钟。无论是中风预测还是糖尿病管理,目标不仅仅是数学优化;它是现实世界医疗知识的应用。当数据是基础,而该基础是有缺陷的,那么由此产生的模型——无论多么复杂——都将是徒劳的尝试。