OpenAI 打擊隱蔽 AI 影響行動

OpenAI 已打擊了五個試圖利用其 AI 模型操縱公共輿論與影響政治結果的隱蔽影響行動(IO)。儘管使用了生成式 AI,這些活動皆未能在受眾互動或觸及上取得顯著提升,且在 Brookings Breakout Scale 上皆得分 2 或以下。

打擊五個隱蔽影響行動

OpenAI 辨識並終止了與五個不同威脅行動者相關的帳號,這些行動者使用 AI 執行生成政治評論、翻譯文章、進行開源研究以及除錯程式碼等任務。

已辨識的威脅行動者

  • Bad Grammar(俄羅斯): 先前未被報導的行動,目標包括烏克蘭、摩爾多瓦、波羅的海國家與美國。行動者使用 AI 除錯 Telegram 機器人程式碼,並以俄文與英文生成短篇政治評論。
  • Doppelganger(俄羅斯): 此行動使用 AI 為 X 與 9GAG 產生英文、法文、德文、義大利文與波蘭文的評論,翻譯與編輯文章,並將新聞故事轉換為 Facebook 貼文。
  • Spamouflage(中國): 此網路使用 AI 研究公開的社群媒體活動,除錯管理網站的程式碼(包括 revealscum[.]com),並為 X、Medium 與 Blogspot 產生中文、英文、日文與韓文的文字內容。
  • International Union of Virtual Media(IUVM,伊朗): 此行動使用 AI 為網站 iuvmpress[.]co 產生與翻譯長篇文章、標題與網站標籤。
  • Zero Zeno(以色列): 與名為 STOIC 的商業公司有關,此行動使用 AI 產生文章與評論,並張貼於 Instagram、Facebook、X 以及相關網站。

這些行動者產生的內容聚焦於全球地緣政治議題,包括烏克蘭入侵、加薩衝突、印度選舉,以及對中國政府的批評。

攻擊者在 AI 使用上的趨勢

對這些行動的調查顯示,AI 被用來提升生產力,而非取代人類操作員。主要趨勢包括:

  • 產量與品質提升: AI 使行動者能以更高的產量與較少的語言錯誤產出文字與圖像,超過單純人類操作員的能力。
  • 混合內容策略: AI 並非唯一使用,而是與傳統形式混合,例如手寫文字與複製的 meme。
  • 模擬互動: 某些網路使用 AI 為自己的貼文產生回覆,以製造虛假的互動假象,然而這並未帶來真實的受眾成長。
  • 營運生產力: AI 被用於非內容任務,例如摘要社群媒體貼文與除錯程式碼。

防禦趨勢與緩解措施

OpenAI 採用多項防禦策略,以減輕隱蔽影響行動的影響並提升偵測速度。

安全系統與設計

OpenAI 將安全系統整合至模型設計中,以對威脅行動者造成阻礙。這導致多次模型拒絕產生所請求的欺騙性內容。

AI 驅動的調查

透過使用內部 AI 驅動的工具,OpenAI 將調查所需時間從數週或數月縮短至僅數天。這些工具用於偵測與分析,類似於 GPT-4 用於內容審查的方式。

散佈與人為錯誤

由於 AI 產生的素材必須透過第三方平台散佈才能觸及受眾,散佈階段仍是攻擊者的關鍵失敗點。此外,OpenAI 指出威脅行動者仍易犯人為錯誤,例如不小心在其公開網站與社群媒體檔案上發布模型的拒絕訊息。

產業合作

OpenAI 與產業同儕分享詳細的威脅指標,並依賴更廣大社群的開源研究,以更有效地辨識與打擊這些行動。

Sources