OpenAI AI 安全合作框架
OpenAI 已确定了四项关键策略,旨在改善 AI 安全规范方面的长期行业合作,以防止竞争压力导致集体行动问题,即公司在安全投入上不足。这种合作对于确保 AI 系统在变得越来越强大时保持安全且有益至关重要。
提高 AI 安全合作的四项策略
为了增加遵守安全标准的可能性,OpenAI 提出了以下四项可操作的策略:
1. 促进对合作的准确认知
行业参与者应沟通与 AI 相关的安全和保障风险,并将共同的担忧转化为共同知识。通过展示可以采取具体步骤来促进合作,公司可以使其在互利机会方面的认知趋于一致。
2. 在共享研究与工程方面进行协作
公司应参与结合互补专业领域的跨学科联合研究。当专注于研究和工程挑战,且其解决方案能为整个领域提供广泛效用时,这种协作尤为有效。
3. 增加透明度与监督
OpenAI 建议将 AI 开发的更多方面开放给适当的监督和反馈。这包括公开行为准则、增加与出版相关的决策过程的透明度,并允许对单个 AI 系统进行审查,前提是解决知识产权和安全担忧。
4. 激励高安全标准
行业应支持经济、法律或全行业范围内的激励机制,以遵守安全标准。这涉及表彰遵循这些标准的组织,并谴责那些未能确保系统安全开发的组织。
解决集体行动问题
AI 行业的竞争压力可能会产生“集体行动问题”,即为了竞争优势而偏离安全规范的动机超过了合作的动机。OpenAI 认为,当安全开发的互利性(例如防止 AI 故障和滥用)高于忽视安全所获得的优势时,合作更有可能实现。
为了减少忽视安全预防措施的诱惑,OpenAI 建议:
- 降低实施成本:降低实施安全措施的成本和难度,使合规更具吸引力。
- 监管环境:政府可以创造一种监管环境,使得违反高风险安全标准的行为受到禁止。
拟议的协作研究领域
OpenAI 主张对跨组织和跨国界的协作进行全面梳理,特别关注具有广泛效用的领域,例如:
- 形式化验证:对 AI 系统能力及其他安全与保障方面的形式化验证进行联合研究。
- AI 向善 (AI for good):在可持续发展和健康等具有广泛积极应用领域的应用项目。
- AI 对抗措施:针对全球性威胁(如在线合成媒体生成的滥用)的联合开发对抗措施。