臨床MLモデルにおける「滑稽なほどにひどい」データセットの危険性
ヘルスケアにおける人工知能の統合は有望ですが、その基盤は完全にトレーニングに使用されるデータに依存しています。Retraction Watchによる最近の報告は、驚くべき現実を明らかにしています。脳卒中や糖尿病を予測するために設計されたいくつかの臨床モデルが、「滑稽なほどにひどい」と表現されるデータセットでトレーニングされていることが判明しました。
この失敗は、単一のモデルアーキテクチャの失敗によるものではなく、むしろ同じソース、つまりトレーニングデータにおける根本的な欠陥によるものです。臨床モデルがKaggleのようなプラットフォームからの合成データや不適切にキュレーションされたデータセットに基づいて構築されるとき、結果として得られる予測は単に不正確であるだけでなく、潜在的に危険です。
Kaggleデータセットの危機
報告書によると、研究者たちは、重大な臨床結果を予測するためのモデルをトレーニングするために、Kaggleで公開されているデータセットを利用してきました。Kaggleは学習や教育目的には優れたツールですが、これらのデータセットは、医療診断ツールに求められる臨床的な厳密さを持ってキュレーションされていることが多くありません。
多くの場合、これらのデータセットには、医療専門家であれば即座に異常事態として察知するであろう、アノマリー(異常値)、合成データポイント、または論理的な不整合が含まれています。しかし、これらのデータセットはアクセスしやすく便利であるため、データの検証よりもモデルの構築を優先する研究者にとっての近道となってしまっています。
データ品質 vs. モデルアーキテクチャ
これらの失敗をめぐる最近の議論において繰り返し現れるテーマは、機械学習(ML)の主な課題はモデル自体であるという誤解です。多くの研究者は、モデルを方程式の複雑な部分として扱い、テストセットにおけるモデルのパフォーマンス指標を成功の証拠として扱います。
Hacker Newsのコミュニティメンバーが指摘しているように、現実は、モデルはプロセスの中でしばしば最も簡単な部分であるということです。真のエンジニアリングの課題は、データの収集とキュレーションにあります。
"モデルを構築することが仕事だと考えている研究者がたくさんいます。彼らは自分自身のデータを収集したくないため、Kaggleで見つけられるデータセットなら何でも使おうとします... これは本末転倒です。モデルは簡単な部分です。良いデータを得ることが仕事の99%です。"
研究者がサンプルの厳格な監査を行わずに「ブラックボックス」なデータセットに依存するとき、彼らは、実際の生物学的疾患マーカーではなく、ノイズや合成的なアーティファクトからパターンを学習してしまうモデルを構築するリスクを犯しています。
手動監査の必要性
これらの「滑稽なほどにひどい」結果を避けるためには、業界はデータ検証に対するより厳格なアプローチへと移行しなければなりません。データセットから数十個のランダムなサンプルを検査するという単純な行為だけで、モデルの損失関数では見えないであろうシステム的な問題を明らかにできることがよくあります。
"データセットの品質は、ML全般において非常に大きな問題です。任意のデータセットから数十個のランダムなサンプルをリストアップすれば、即座に何か奇妙なことが起きていることに気づくでしょう。"
臨床MLにとって、これは極めて重要な必要性です。医療予測に使用されるいかなるデータセットも、臨床的な妥当性が検証され、合成データの混入が監査され、明確なプロベナンス(由来)を持つ検証済みの医療記録から取得される必要があります。
結論
臨床モデルのための低品質なデータセットの使用は、AI分野の他の領域に対する警告として機能します。脳卒中予測であれ糖尿病管理であれ、目標は単なる数学的な最適化ではなく、現実世界の医学的知識の適用です。データが基盤であり、その基盤が欠陥だらけであれば、結果として得られるモデルは、どれほど洗練されていても、無益な試みとなるでしょう。