OpenAI 阻断 AI 的恶意使用
OpenAI 已实施一个系统来阻断其 AI 工具的恶意使用,重点在于防止威权政权和国家关联的威胁行为者利用 AI 获取权力、胁迫其他国家或进行隐蔽影响行动。此方法是更广泛使命的一部分,旨在通过应用常识规则来保护人们免受实际伤害,从而确保通用人工智能造福人类。
阻断恶意 AI 使用的技术方法
OpenAI 的策略是阻断恶意 AI 使用,重点在于防止威权政权使用 AI 工具来控制公民或威胁其他国家。该组织强调使用 AI 驱动的调查能力,以保护民主 AI 免受对手威权政权的措施。
目标威胁类别
- 隐蔽影响行动 (IOs): 防止使用 AI 通过隐藏来源操纵公众舆论或传播错误信息。
- 恶意网络活动: 阻断国家关联行为者可能用于进行网络攻击的活动。
- 隐蔽影响行动 (IOs): 防止使用 AI 工具以促进儿童剥削、诈骗和垃圾邮件。
合作与报告
OpenAI 已建立发布报告的惯例,以报告其对恶意行为者的阻断。这是第一个这样做的 AI 研究实验室,而此最新报告概述了 AI 驱动工作的趋势和特点,提供了被阻断威胁的案例研究。这些报告旨在支持美国及其盟友政府、行业合作伙伴和其他利益相关者共享的目标,以防止对手和恶意行为者的滥用。
Sources
- OriginalDisrupting malicious uses of AI