OpenAI 打击隐蔽 AI 影响行动

OpenAI 已经打击了五个试图利用其 AI 模型操纵公众舆论并影响政治结果的隐蔽影响行动(IO)。尽管使用了生成式 AI,但这些活动均未实现受众参与度或覆盖面的显著提升,所有活动在 Brookings Breakout Scale 上的得分均为 2 或更低。

打击五个隐蔽影响行动

OpenAI 识别并终止了与五个不同威胁行为体相关的账户,这些行为体使用 AI 完成生成政治评论、翻译文章、进行开源研究以及调试代码等任务。

已识别的威胁行为体

  • Bad Grammar (Russia): 一个此前未被报道的行动,针对乌克兰、摩尔多瓦、波罗的海国家和美国。行为体使用 AI 调试 Telegram 机器人代码,并生成俄语和英语的简短政治评论。
  • Doppelganger (Russia): 该行动使用 AI 为 X 和 9GAG 生成英文、法文、德文、意大利文和波兰文评论,翻译并编辑文章,并将新闻故事转换为 Facebook 帖子。
  • Spamouflage (China): 该网络使用 AI 研究公共社交媒体活动,调试用于管理网站的代码(包括 revealscum[.]com),并为 X、Medium 和 Blogspot 生成中文、英文、日文和韩文文本。
  • International Union of Virtual Media (IUVM, Iran): 该行动使用 AI 为网站 iuvmpress[.]co 生成并翻译长篇文章、标题和网站标签。
  • Zero Zeno (Israel): 与一家名为 STOIC 的商业公司关联,该行动使用 AI 生成文章和评论,发布在 Instagram、Facebook、X 以及相关网站上。

这些行为体生成的内容聚焦于全球地缘政治议题,包括乌克兰入侵、加沙冲突、印度选举以及对中国政府的批评。

攻击者在 AI 使用方面的趋势

对这些行动的调查显示,AI 被用于提升生产力,而非取代人工操作员。主要趋势包括:

  • 产出量与质量提升: AI 使行为体能够以更高的产出量和更少的语言错误生成文本和图像,超出单纯人工操作的能力。
  • 混合内容策略: AI 并非唯一使用,而是与传统形式相结合,如手工撰写的文本和复制的表情包。
  • 模拟互动: 某些网络使用 AI 为自己的帖子生成回复,以制造虚假的互动假象,然而这并未带来真实的受众增长。
  • 运营效率提升: AI 被用于非内容任务,如概括社交媒体帖子和调试代码。

防御趋势与缓解措施

OpenAI 采用多种防御策略,以减轻隐蔽影响行动的影响并提升检测速度。

安全系统与设计

OpenAI 将安全系统集成到模型设计中,以对威胁行为体制造阻力。这导致模型多次拒绝生成请求的欺骗性内容。

AI 驱动的调查

通过使用内部 AI 驱动的工具,OpenAI 将调查所需时间从数周或数月缩短至仅几天。这些工具用于检测和分析,类似于 GPT-4 在内容审核中的使用方式。

分发与人为错误

由于 AI 生成的内容必须通过第三方平台分发才能触达受众,分发阶段仍是攻击者的关键失效点。此外,OpenAI 指出,威胁行为体仍易出现人为错误,例如误将模型的拒绝信息发布在其公开网站和社交媒体资料上。

行业合作

OpenAI 与行业同行共享详细的威胁指示,并依赖更广泛社区的开源研究,以更有效地识别和打击这些行动。

Sources