OpenAI 打擊隱蔽 AI 影響行動
OpenAI 已打擊了五個試圖利用其 AI 模型操縱公共輿論與影響政治結果的隱蔽影響行動(IO)。儘管使用了生成式 AI,這些活動皆未能在受眾互動或觸及上取得顯著提升,且在 Brookings Breakout Scale 上皆得分 2 或以下。
打擊五個隱蔽影響行動
OpenAI 辨識並終止了與五個不同威脅行動者相關的帳號,這些行動者使用 AI 執行生成政治評論、翻譯文章、進行開源研究以及除錯程式碼等任務。
已辨識的威脅行動者
- Bad Grammar(俄羅斯): 先前未被報導的行動,目標包括烏克蘭、摩爾多瓦、波羅的海國家與美國。行動者使用 AI 除錯 Telegram 機器人程式碼,並以俄文與英文生成短篇政治評論。
- Doppelganger(俄羅斯): 此行動使用 AI 為 X 與 9GAG 產生英文、法文、德文、義大利文與波蘭文的評論,翻譯與編輯文章,並將新聞故事轉換為 Facebook 貼文。
- Spamouflage(中國): 此網路使用 AI 研究公開的社群媒體活動,除錯管理網站的程式碼(包括 revealscum[.]com),並為 X、Medium 與 Blogspot 產生中文、英文、日文與韓文的文字內容。
- International Union of Virtual Media(IUVM,伊朗): 此行動使用 AI 為網站 iuvmpress[.]co 產生與翻譯長篇文章、標題與網站標籤。
- Zero Zeno(以色列): 與名為 STOIC 的商業公司有關,此行動使用 AI 產生文章與評論,並張貼於 Instagram、Facebook、X 以及相關網站。
這些行動者產生的內容聚焦於全球地緣政治議題,包括烏克蘭入侵、加薩衝突、印度選舉,以及對中國政府的批評。
攻擊者在 AI 使用上的趨勢
對這些行動的調查顯示,AI 被用來提升生產力,而非取代人類操作員。主要趨勢包括:
- 產量與品質提升: AI 使行動者能以更高的產量與較少的語言錯誤產出文字與圖像,超過單純人類操作員的能力。
- 混合內容策略: AI 並非唯一使用,而是與傳統形式混合,例如手寫文字與複製的 meme。
- 模擬互動: 某些網路使用 AI 為自己的貼文產生回覆,以製造虛假的互動假象,然而這並未帶來真實的受眾成長。
- 營運生產力: AI 被用於非內容任務,例如摘要社群媒體貼文與除錯程式碼。
防禦趨勢與緩解措施
OpenAI 採用多項防禦策略,以減輕隱蔽影響行動的影響並提升偵測速度。
安全系統與設計
OpenAI 將安全系統整合至模型設計中,以對威脅行動者造成阻礙。這導致多次模型拒絕產生所請求的欺騙性內容。
AI 驅動的調查
透過使用內部 AI 驅動的工具,OpenAI 將調查所需時間從數週或數月縮短至僅數天。這些工具用於偵測與分析,類似於 GPT-4 用於內容審查的方式。
散佈與人為錯誤
由於 AI 產生的素材必須透過第三方平台散佈才能觸及受眾,散佈階段仍是攻擊者的關鍵失敗點。此外,OpenAI 指出威脅行動者仍易犯人為錯誤,例如不小心在其公開網站與社群媒體檔案上發布模型的拒絕訊息。
產業合作
OpenAI 與產業同儕分享詳細的威脅指標,並依賴更廣大社群的開源研究,以更有效地辨識與打擊這些行動。