Greg Kroah-Hartmanが語るLLM生成のセキュリティ調査結果:Mythosは過大評価、実際の修正はわずか

要点

Greg Kroah‑Hartman氏は、Mythos LLMがLinuxカーネルのバグを79件発見したという主張について、実際には10件の真の課題に過ぎず、そのほとんどが些細なものであり、約1時間のカーネル開発で修正されたことを明らかにしました。このエピソードは、LLM主導の誇大広告と、セキュリティ研究におけるそのようなツールの実用的な価値との間のギャップを浮き彫りにしています。


Mythosの報告数と現実

結論: 報告された79件の脆弱性の大部分は、問題ではないか、すでに修正済みか、あるいは捏造されたものでした。

  • 79件のCVE報告が、Kernel Recipes 2026の講演でMythosによって提示されました。
  • 内訳(Greg Kroah‑Hartman氏の引用による):
    • 24件:詳細なし – 「何かがクラッシュした」という記述のみ。
    • 14件:バグですらない。
    • 3件:完全に捏造されたデータ。
    • 15件:最新のカーネルリリースで修正済み。
    • 11件:他の貢献者によって修正済み。
    • 4件:Anthropicによって修正済み。
    • 20件:修正が必要(唯一の実質的なグループ)。
    • 7件:悪意のあるファイルシステムイメージを想定。
    • 2件:悪意のあるネットワークパケットの注入を想定。
    • 2件:「NOMMU」の問題。
    • 6件:信頼できないデバイス向けのSCTPネットワークの問題。
    • 2件:軽微なIPv6ネットワークの問題。
    • 1件:ローカルの悪意のあるユーザー向けのGPUドライバーの問題。

Greg氏は、10件の「真の」バグ修正をMythosからの唯一の有意義な成果とし、残りはノイズであるか、すでに対処済みであったと強調しました。


必要な開発工数

結論: 真の課題を修正するのに要した時間は、約1時間のカーネル開発でした。

  • Greg氏は、10件の真の修正が約1時間の作業で完了したと明言しました。
  • この迅速な対応は、実質的な発見が些細なものであり、広範なエンジニアリングの努力を必要としなかったことを示唆しています。

LLMベースのセキュリティツールへの影響

結論: LLMは多くの明白なバグを表面化させることができますが、厳密な検証なしでは高い誤検知率を生み出し、認識される影響を誇張してしまいます。

  • パターンマッチングアプローチ: あるコメント投稿者が指摘したように、Mythosは過去のカーネルパッチに対するパターンマッチングを使用し、その後同じヒューリスティックを他の場所に適用しました。この手法は、新しい脆弱性を発見するのではなく、既知の修正を再現するものです。
  • 過大評価のリスク: 見出し(79件のバグ)と現実(10件の軽微な修正)の乖離は、「危険な」能力を持つというLLMの主張に対する懐疑論を煽っています。
  • 人間のレビューが不可欠: 複数のコメント投稿者が、結果を検証し誤解を招く結論を避けるためには、依然として人間の専門知識が必要であることを強調しました。

法的および倫理的懸念

結論: LLMのトレーニングにおけるプロプライエタリコードの使用は、Linuxカーネルのようなオープンソースプロジェクトに影響を与える未解決の法的問題を提起しています。

  • Greg氏は、LG Researchを引用し、トレーニングコーパスの20%のみが法的に許容されるデータであると述べました。
  • 著作権で保護されたソースから派生した可能性のあるLLM生成コードの使用の合法性については、裁判所の判断に委ねました。
  • この問題に関するLinuxコミュニティのスタンスは依然として不明確であり、侵害の可能性があるLLM出力を扱うためのポリシーの欠如を浮き彫りにしています。

コミュニティの反応

結論: Hacker Newsの議論は、セキュリティにおけるLLMに対する批判、慎重さ、そして楽観主義が入り混じったものとなっています。

"Mythosは過大評価され、過剰に宣伝されていた。" – 1sgT15

"非対称性が致命的だ。レポートの生成は今やほぼ無料だが、検証コストは全く変わっていない。" – shieldagent

"LLMは貢献者間の技術的なコラボレーションをほぼ台無しにしてしまった…" – asaiacai

これらのコメントは中心的なテーマを反映しています:LLMが生成したバグ報告は作成コストが安いが、それを検証するコストは下がらない。


今後の展望:LLMはどのように役立つ可能性があるか

結論: Mythosのような現在の実装には限界がありますが、ドメイン固有のデータでトレーニングされた専門モデルは、厳密な検証パイプラインと組み合わせれば価値のあるものになる可能性があります。

  • あるコメント投稿者は、Linuxカーネルの標準、脅威モデル、コーディングパターンでトレーニングされた専用モデルが、人間のレビューの前に**発見結果をトリアージ(選別)**できる可能性があると提案しました。
  • Microsoftは同様の目的で内部モデルを実験していると報じられており、課題はあるものの業界の関心を示しています。

結論

Greg Kroah‑Hartman氏の分析は、Mythos LLMの「79件のカーネルバグ」という見出しを飾る主張が大部分において誇張されており、実際に修正されたのは一握りの些細な問題に過ぎないことを示しています。このエピソードは、LLMが信頼できるセキュリティツールとして認められる前に、人間の専門知識、慎重な検証、そしてより明確な法的枠組みが必要であることを強調しています。

Sources

関連