Hugging Face 对白宫 AI 行动计划信息请求的回应
Hugging Face 已向白宫科学技术政策办公室提交了关于白宫 AI 行动计划的信息请求(RFI)的正式回应。公司主张,开放的 AI 系统和开放科学对于提升性能、提高资源效率以及确保最高的安全性和可靠性标准至关重要。
开源模型的性能与效率
开放的 AI 开发方法在许多任务上持续复制或超越仅提供 API 的商业产品的性能,且通常在更短的时间内实现,并且资源效率更高。
以下两个主要示例说明了这一趋势:
- OlympicCoder:一个使用开源后训练方案的 7B 参数模型,在复杂编码任务上表现优于 Claude 3.7。
- OLMo 2:AI2 完全开源的模型,包含开放的训练数据,其性能可与 o1-mini 相匹配。
建议 1:开源与开放科学作为基础
开放研究和开源软件为所有先进 AI 系统提供了关键基础。Hugging Face 强调,核心进展——如注意力机制、Transformer 架构以及高效的后训练算法——都是基于开放研究构建的。同样,诸如 PyTorch 和 Hugging Face 库等关键软件也是开源的。
为保持技术和经济的成功,Hugging Face 建议优先考虑:
- 公共研究基础设施。
- 广泛获取计算资源。
- 可定制的模型和可信的开放数据集,尤其是面向小型开发者和研究者。
建议 2:优先考虑效率与可靠性
广泛的创新需要解决采用 AI 的组织所面临的资源限制。Hugging Face 认为,专注于效率能够实现技术的更广泛扩散,并促进整个开发链的创新。
关键技术重点包括:
- 更小的模型:开发能够在边缘设备上运行的模型。
- 推理优化:实施技术以降低推理期间的计算需求(例如量化)。
- 中等规模训练:为计算资源有限的组织提供训练支持。
这些高效、专用设计的系统在高风险环境(如医疗保健)中更为可靠,因为通用模型往往表现不佳。它们还能够实现更好的上下文评估和资源利用。
建议 3:通过透明性和可追溯性实现安全
基于在开源软件领域数十年的网络安全经验,Hugging Face 认为,开放且透明的 AI 系统是关键部署的最安全路径。不同的安全需求需要不同程度的开放性:
- 完全透明的模型:提供训练数据和流程访问的模型最适合进行广泛的安全认证。
- 开放基础设施和工具:实现最新训练技术的开源工具使组织能够在完全受控的环境中训练模型。
- 开放权重模型:这些模型可部署在隔离网络环境中,以管理信息风险。
通过优先采用透明系统并构建相应的使用能力,组织能够确保更安全的 AI 采用。