预测语言模型在错误信息宣传活动中的滥用

OpenAI 与乔治城大学安全与新兴技术中心(Center for Security and Emerging Technology)以及斯坦福互联网观察站(Stanford Internet Observatory)合作,发布了一份报告,调查大型语言模型(LLM)在错误信息宣传活动中可能被滥用的风险。研究得出结论,LLM 很可能通过降低成本、扩大规模以及提升欺骗性内容的说服力,彻底改变在线影响行动。

LLM 对影响行动的影响

大型语言模型有可能改变影响行动的三个核心要素:行为主体、行为方式和内容本身。

行为主体

LLM 可能降低开展影响行动的资金和技术门槛。这将使新类型的行为主体进入该领域,并为能够自动化文本生产的“受雇宣传者”提供竞争优势。

行为方式

借助 LLM,影响行动的规模可以大幅提升,使得昂贵的策略——例如生成高度个性化的内容——成本显著下降。此外,LLM 还能催生新战术,包括使用聊天机器人进行实时内容生成。

内容

LLM 能生成比人类宣传者更具说服力或冲击力的信息,尤其是在宣传者缺乏目标受众的文化或语言知识时。更重要的是,LLM 使这些行动更难被检测,因为它们能够持续生成独特内容,避免了手工活动中常用的重复复制粘贴模式。

AI 驱动错误信息的关键未知因素

尽管已识别出风险,但仍有若干变量未知,需要进一步研究以确定威胁的实际规模:

  • 新兴能力:哪些本意良好的商业或研究投资会意外为影响行动创造新能力?
  • 行为主体投资:哪些具体行为主体会在 LLM 技术上投入最大力度?
  • 工具可用性:易用的文本生成工具何时会公开?专用于影响的模型是否会比通用模型更有效?
  • 规范与动机:社会或政治规范是否会形成,以抑制在影响行动中使用 AI?

四阶段缓解框架

为应对这些威胁,报告提出了一个管道框架,识别出四个可以实施缓解措施的阶段,以破坏影响行动的链条。

管道阶段 示例性缓解措施
1. 模型构建 构建对事实敏感的模型;散布“放射性数据”以使模型可被检测;政府对数据收集或 AI 硬件访问进行限制。
2. 模型访问 实施更严格的使用限制;制定模型发布新规范;修补安全漏洞。
3. 内容传播 平台与 AI 提供商协作识别 AI 生成内容;发布内容时要求“身份真实性证明”;采用数字来源溯源标准。
4. 信念形成 开展媒体素养宣传活动;提供面向消费者的 AI 工具,帮助用户识别错误信息。

评估缓解措施的可取性

报告强调,缓解措施的存在并不自动意味着它是可取的。政策制定者和开发者应使用以下四个指导性问题来评估潜在干预措施:

  1. 技术可行性:该缓解措施是否需要对现有技术基础设施进行重大改动?
  2. 社会可行性:在现行法律法规下该措施是否可执行,关键行为主体是否有动力实施?
  3. 负面风险:该缓解措施可能带来哪些负面影响?
  4. 影响力:该缓解措施在实际降低威胁方面的效果如何?

无论是将先进模型保持私有还是通过 API 限制访问,研究人员都预期宣传者将转向开源替代方案,或是国家层面自行发展内部能力。

Sources