美国军方因人工智能生成的虚假情报险些引发战争
人工智能生成的虚假情报差点引发美国针对中国船只的军事行动
在美国一名分析师利用人工智能辅助生成的报告声称一艘中国船只载有核武器部件后,美军准备在海湾地区拦截该船。深入审查后发现,该报告完全是由聊天机器人捏造的,从而避免了一场可能导致灾难性升级的事件。
为什么这次事件很重要
- 直接的战争风险 – 基于虚假数据对中国船只部署兵力,可能会演变成美中之间的直接冲突。
- 揭示了系统性的人工智能危害 – 该事件表明,未经核实的人工智能输出如何渗透到高风险的决策流程中。
- 凸显了监管漏洞 – 五角大楼分散的人工智能工具之间缺乏统一的验证标准,导致“幻觉”能够传达到高级指挥官手中。
虚假报告是如何产生的
- 开源与机密数据融合 – 分析师向聊天机器人查询了来自美国特种作战司令部太平洋分部的清单。该模型将开源情报与秘密信号情报进行了混合。
- 幻觉式的货物识别 – 模型错误地断定该船载有核武器材料;被误认货物的具体性质未被披露。
- 自动化报告生成 – 分析师使用同一个人工智能将调查结果格式化为标准情报简报,随后在军中传阅。
"这些内部工具大多只是披着外衣的商业产品复制品," 一位熟悉军用人工智能系统的前美国高级官员表示。 — @handle
国防部对人工智能的广泛推动
- 人工智能加速战略 – 2026年1月,国防部长 Pete Hegseth 宣布了一项旨在三百万文职和军事人员中“普及人工智能实验”的战略,旨在保持美国对对手的领先地位。
- 去中心化部署 – 不同的军种和机构在不一致的安全协议下使用各种商业或政府构建的模型。
- 缺乏验证标准 – 目前没有单一的框架来审查人工智能生成的情报,导致每个单位只能依赖临时检查。
来自 hacker-news 讨论的教训
- 对幻觉的技术解释 – 评论者 drtgh 提醒说,大语言模型 (LLMs) 是统计文本生成器;当模型将不相关的索引数据拼凑在一起时,错误是内在的。
- 历史相似之处 – jmward01 将此次事件与过去美国的情报失败(例如伊拉克大规模杀伤性武器声明)进行了比较,指出人工智能只是放大了现有的、为了证明目标合理性而制造叙事的压力。
- 人在回路的担忧 – 多位评论者强调,如果没有明确的指导,"在目标定位中使用人工智能……对于如何通过人在回路来防止平民伤亡或误伤友军,并没有真正的指导。"
- 文化风险 – 在人工智能工具环境下成长起来的年轻分析师可能会不加批判地信任输出结果,正如一位消息人士所言:"人工智能让你更快地得出一个糟糕的想法。"
- 战略警告 – 几条评论将此事件描述为人工智能驱动的误判带来的“直接风险”的具体例子,与推测性的生存威胁形成了对比。
该事件揭示了当前军方人工智能治理的现状
| 问题 | 观察 | 影响 |
|---|---|---|
| 工具来源 | 不清楚聊天机器人是商业模型还是政府构建的模型。 | 缺乏透明度阻碍了问责制和风险评估。 |
| 验证工作流 | 在分发前没有标准化流程来交叉检查人工智能生成的情报。 | 幻觉可能在未经检查的情况下传达到决策者手中。 |
| 训练数据偏差 | 在混合开源和机密数据上训练的模型可能会继承地缘政治偏见。 | 错误识别可能系统性地偏向某些威胁叙事。 |
| 人工监督 | 消息人士指出,在目标定位的“人在回路”保障措施方面“没有真正的指导”。 | 操作员可能过度依赖人工智能,降低了关键审查。 |
| 政策碎片化 | 多个人工智能项目在不同的命令和安全标准下运行。 | 部门间可靠性不一致,增加了系统性风险。 |
减轻人工智能驱动的情报失败的建议
- 强制进行独立验证 – 在投入作战使用之前,每一份人工智能生成的情报产品都应由人类分析师使用独立数据源进行交叉检查。
- 标准化验证协议 – 国防部应发布一个统一的框架(例如模型输出置信度评分、来源日志),所有军种必须采用。
- 审计训练数据的偏差 – 对为军事大语言模型提供数据的训练集进行定期审查,特别是那些结合了开源和机密输入的数据集。
- 限制人工智能在致命目标定位中的使用 – 在存在稳健、可审计的保障措施之前,将人工智能的辅助限制在咨询角色,而非最终的杀伤决策权。
- 实施版本控制和来源追踪 – 由人工智能系统生成的每一份报告都应嵌入元数据,标明模型版本、提示词和数据来源。
总结
2026年9月的近战事件表明,人工智能幻觉不是一个理论上的担忧,而是一个具体的作战危害。如果没有统一的验证标准、去中心化的工具管理和严格的人工监督,人工智能可能会将美军推向灾难性的误判。这一事件应促使立即采取政策行动,将严格的检查嵌入到人工智能辅助情报生产的每一个阶段。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch