OpenAI、Cohere 和 AI21 Labs 部署语言模型的最佳实践
OpenAI、Cohere 和 AI21 Labs 为开发或部署大型语言模型(LLM)的组织制定了一套初步的最佳实践。这些指南旨在降低强大 AI 技术带来的风险,确保其增强人类能力的同时将危害降至最低。
禁止语言模型的滥用
LLM 提供商应实施严格的使用指南和技术基础设施,以防止该技术被用于恶意目的。
- 使用指南和使用条款: 提供商必须发布明确的条款,禁止对社会、个人和社区造成实质性伤害。这包括禁止将 LLM 用于垃圾邮件、欺诈或假装草根运动(astroturfing)。此外,指南应识别需要额外审查或完全禁止的高风险使用场景,例如基于受保护特征对人进行分类。
- 执行基础设施: 为确保遵守使用指南,提供商应构建系统,如速率限制、内容过滤、生产访问的应用审批流程以及异常活动监控。
缓解非故意伤害
由于没有任何预防措施能够完全消除非故意伤害的潜在可能性,提供商必须主动处理模型行为,并对剩余的漏洞保持透明。
- 主动缓解: 提供商应采用全面的模型评估来评估局限性,并使用诸如从人类反馈中学习等技术以最小化不安全行为。还应努力减少训练语料库中潜在的偏见来源。
- 弱点文档化: 提供商必须记录已知的漏洞,包括模型生成不安全代码的能力或固有偏见。该文档应包括针对模型及其预期使用场景的安全最佳实践。
利益相关者合作与伦理劳动
负责任的部署需要多元化的视角和全行业的透明度,以解决模型在真实世界中的运行方式。
- 多元化团队: 组织应组建背景多样的团队,以确保模型不会强化偏见或对特定人群失效。
- 公开披露: 应公开分享关于 LLM 安全性和滥用的经验教训,以促进跨行业迭代并广泛采用安全标准。
- 劳动标准: 提供商必须尊重 LLM 供应链中的所有劳动。这包括保持对内部审查模型输出人员的工作条件的高标准,并确保第三方供应商遵守明确的标准,例如允许标注员选择不参与特定任务。
行业支持与观点
该联合建议已获得多个 AI 组织和研究中心的支持,强调了行业合作的重要性。
"虽然 LLM 充满潜力,但它们存在显著的固有安全问题,需要加以解决。这些最佳实践是降低模型危害、最大化潜在收益的重要一步。"
—Anthropic
"随着大型语言模型(LLM)变得日益强大和表现力更强,风险缓解变得愈发重要。我们欢迎这些以及其他主动寻求减轻危害并向用户强调需要额外谨慎领域的努力。"
—John Bansemer,CyberAI 项目主任兼安全与新兴技术中心(CSET)高级研究员
"Google 确认在分析模型和训练数据时采用综合策略以降低伤害、偏见和误导风险的重要性。"
"要实现大型语言模型的承诺,我们必须继续作为一个行业进行合作,并分享负责任开发和部署它们的最佳实践,同时降低潜在风险。"
— Microsoft
"基础模型(如大型语言模型)的安全性正成为日益关注的社会议题。我们赞扬 Cohere、OpenAI 和 AI21 Labs 迈出第一步,概述负责任开发和部署的高层原则……"
— Percy Liang,斯坦福基础模型研究中心(CRFM)主任