OpenAI 阻止 AI 惡意使用報告(2025 年 6 月)
OpenAI 正在利用 AI 驅動的調查工具,偵測並阻止諸如隱蔽影響行動、網路間諜活動與社交工程等惡意活動。此做法為專業團隊提供了力量倍增器,使其能更有效率地識別與揭露濫用行為。
AI 安全與治理的策略框架
OpenAI 依循一套框架運作,該框架以常識規則與民主 AI 的發展為核心,優先保護人們免受實際傷害。此策略著重於防止威權政權利用 AI 工具鞏固權力、控制公民或胁迫其他國家。
防止 AI 濫用的重點領域包括:
- 隱蔽影響行動(IO)
- 兒童剝削
- 詐騙與垃圾訊息
- 惡意網路活動
最近的阻斷行動與案例研究
在 2025 年 6 月報告之前的三個月內,OpenAI 的調查團隊利用 AI 偵測並揭露多類濫用行為。透過將 AI 整合至防禦機制,該組織成功阻止了以下項目:
- 隱蔽影響行動:識別旨在操縱公共輿論的欺騙性活動。
- 網路間諜:偵測利用 AI 進行未授權資料存取或情報蒐集的企圖。
- 社交工程:防止依賴心理操控以欺騙使用者的攻擊。
- 欺詐性就業計畫:揭露作為詐騙或資料竊取載體的虛假職缺。
- 一般詐騙:阻止各種 AI 支援的詐騙活動。
與美國 AI 行動計畫的對齊
這些努力與 OpenAI 於三月向科學技術政策辦公室提交的美國 AI 行動計畫相呼應。該組織認為,要確保 AI 造福人類,需要雙管齊下:制定防止傷害的規則,並部署 AI 工具以賦能防止系統性濫用的守護者。