OpenAI 阻斷惡意使用 AI

OpenAI 已實施一個系統來阻斷其 AI 工具的惡意使用,重點在於防止威權政權和國家關聯的威脅行為者利用 AI 來攬取權力、脅迫其他國家或進行隱密影響行動。此方法是更廣泛使命的一部分,旨在通過應用常識規則來保護人們免受實際傷害,以確保通用人工智慧造福人類。

阻斷惡意使用 AI 的技術方法

OpenAI 阻斷惡意使用 AI 的策略重點在於防止威權政權使用 AI 工具來控制公民或威脅其他國家。該組織強調使用具備 AI 能力的調查手段,以保護民主的 AI 不受對手威權政權的措施影響。

目標威脅類別

OpenAI 辨識出幾個 AI 工具可能被用來促成的高風險惡意活動的關鍵領域。包括:

  • 隱密影響行動 (IOs): 防止透過隱藏來源使用 AI 操縱輿論或散播錯誤資訊。
  • 惡意網路活動: 干擾國家關聯行為者可能用來進行網路攻擊的活動。
  • 隱密影響行動 (IOs): 防止使用 AI 工具來協助兒童剝削、詐騙和垃圾郵件。

合作與報告

OpenAI 已建立發布報告的慣例,以說明其對惡意行為者的阻斷行動。這是首個這樣做的 AI 研究實驗室,而此最新報告概述了 AI 驅動工作的趨勢與特徵,並提供了被阻斷威脅的案例研究。這些報告旨在支援美國及其盟友政府、產業合作夥伴和其他利益相關者所共有的目標,以防止對手和惡意行為者的濫用。

Sources