开源开发者指南:欧盟 AI 法案
概述
欧盟 AI 法案现已生效,影响着在 EU 发布影响人们的 AI 模型或系统的开源开发者。本指南提供了该法规的非法律建议介绍,解释了哪些活动受到约束,并列出了可帮助满足要求的实际步骤和 Hugging Face 工具。
范围
AI 法案制定的规则取决于角色(提供者、部署者、分销者)以及制品是 AI 模型还是 AI 系统。
- Model:仅通用人工智能(GPAI)模型直接受到监管。GPAI 模型在大量数据上训练,表现出显著的通用性,能够执行多种任务,并且可以用于系统中(例如,一个大型语言模型)。微调版本也需要遵守。
- System:任何能够从输入进行推断的制品,例如使用 LLM 的聊天机器人或 Hugging Face Spaces 上的 Gradio 应用。 风险等级:
- 不可接受风险:禁止的系统(例如,人脸图像抓取)。
- 高风险:影响安全或基本权利的系统(例如,关键基础设施)。
- 有限风险:直接与人互动且可能导致冒充、操纵或欺骗的系统(大多数生成式 AI 集成)。这些需要透明措施。
- 最低风险:大多数系统;仅适用现有法律。 对于 GPAI 模型,还有一个额外的 系统性风险 类别:训练算力超过 10^25 FLOPs 或具有高影响能力的模型。指南中引用的一项斯坦福研究估计,截至 2024 年 8 月,只有七家开发者的八个模型(Gemini 1.0 Ultra、Llama 3.1‑405B、GPT‑4、Mistral Large、Nemotron‑4 340B、MegaScale、Inflection‑2、Inflection‑2.5)满足默认的系统性风险阈值。
如何准备合规
本指南侧重于有限风险 AI 系统和开源非系统性风险 GPAI 模型,这些覆盖了 Hub 上大多数公开可用的模型。
有限风险 AI 系统
有限风险 AI 系统的开发者必须:
- 除非明显,否则必须向用户披露他们正在与 AI 系统交互,使用清晰且详尽的语言。
- 以机器可读格式标记合成内容(音频、图像、视频、文本)为人工生成或被操纵;诸如 Gradio 内置水印之类的工具可以提供帮助。 如果作为部署者(专业使用 AI 系统),额外职责包括向个人告知情绪识别或生物识别系统,并在不损害体验的情况下披露艺术作品中的深度伪造或 AI 生成内容。AI 办公室预计将在 2025 年 5 月发布实践准则,执行将从 2026 年 8 月开始。
开源非系统性风险 GPAI 模型
对于不存在系统性风险的开源 GPAI 模型,AI 法案将开源定义为在允许共享、使用、修改和再分发的自由及开源许可证下发布的软件和数据。开发者应选择符合此定义的许可证(Hub 提供列表)。义务包括:
- 使用 AI Office 将提供的模板(细节水平仍在讨论中)起草并提供充分详细的训练数据摘要。
- 实施政策以遵守欧盟版权法,尊重权利持有者的退出选择。仅在权利持有者未选择退出的情况下,才允许对受版权保护的材料进行训练;开发者可以首先遵守 robots.txt 信号并使用如 Spawning’s API 之类的工具。 指南指出,现有的 Hugging Face 集成——例如模型卡、数据集卡、Gradio 水印、BigCode “Am I In The Stack” 退出应用、个人数据脱敏工具和许可证处理——可以支持这些任务。版权合规的实践准则预计将在 2025 年 5 月发布。
如果模型的发布方式不符合 AI 法案的开源定义,则会适用其他义务。如果 GPAI 模型满足系统性风险标准,开发者必须向欧盟委员会通报;他们可以主张该模型不具系统性风险,但如果委员会驳回该主张,模型将面临进一步义务,例如提供完整的技术文档。GPAI 模型的义务将于 2025 年 8 月生效。
参与其中
AI 法案的实际应用仍在通过公众咨询和工作组塑造中。本指南鼓励开发者现在参与,以影响针对中小企业和研究者的条款如何落地。
免责声明:本指南提供的信息仅供参考,不应被视为任何形式的法律建议。
@misc{eu_ai_act_for_oss_developers,
author = {Bruna Trevelin and Lucie-Aimée Kaffee and Yacine Jernite},
title = {Open Source Developers Guide to the EU AI Act},
booktitle = {Hugging Face Blog},
year = {2024},
url = {},
doi = {}
}