Hugging Face SafeCoder 公告

TL;DR

Hugging Face 已推出 SafeCoder,这是一个面向企业的完整商业解决方案,用于部署自托管且完全合规的代码助手。它使公司能够在其自身的 Virtual Private Cloud (VPC) 中,使用自己的专有代码库微调并运行 Code 大型语言模型 (LLM),确保敏感知识产权永不离开其安全环境。

SafeCoder: 企业级代码助手

SafeCoder 不是一个独立的模型,而是一个端到端的商业解决方案,旨在提供 AI 编程伴侣的生产力优势,同时消除与闭源 LLM 相关的安全和合规风险。

Key characteristics of the SafeCoder solution include:

  • Self-Hosting: 专为在客户自身基础设施上部署而设计。
  • Data Sovereignty: 在训练或推理阶段,代码永不会离开客户的 VPC。
  • Ownership: 客户拥有其生成的微调 Code LLM。
  • Hardware Flexibility: 支持广泛的加速器,包括 NVIDIA Ampere GPU、AMD Instinct GPU、Habana Gaudi2、AWS Inferentia 2 和 Intel Xeon Sapphire Rapids CPU。

技术基础:StarCoder 系列

SafeCoder 的初始版本由 BigCode 项目开发的 StarCoder 模型系列提供支持(这是 Hugging Face、ServiceNow 和开源社区的合作项目)。

StarCoder 为企业使用提供了几个技术优势:

  • Performance: 一个 15B 参数的模型,针对推理进行了优化,使用 Multi-Query Attention(减少内存占用)和 Flash Attention(可扩展至 8,192 token 上下文)。
  • Ethical Sourcing: 在 “The Stack” 上进行训练,该数据集仅包含商业上允许的许可代码,内置了开发者退出机制、PII 删除和去重。
  • Adaptability: 由于其建立在开源基础之上,SafeCoder 可以随着新版更强大的开源模型的出现而进行更新以利用这些模型。

隐私、安全与合规

SafeCoder 解决了企业在采用 AI 编程助手时面临的主要障碍:在微调或推理过程中泄露专有代码的风险。

隐私与安全实现

在设置阶段,Hugging Face 提供了客户准备和去标识内部代码库以形成训练数据集所需的容器、脚本和示例。此训练在 Hugging Face 提供的、配置为客户自身硬件的容器内进行。对于部署,Hugging Face 提供了暴露在客户 VPC 内的私有端点的推理容器。

合规与法律风险缓解

SafeCoder 利用 BigScience 和 BigCode 的合规工作来最小化法律风险。具体来说,SafeCoder 生成的代码补全将与 The Stack 进行核对。这使用户能够识别建议的代码是否与现有源数据匹配,并验证相关许可证,使客户能够执行其首选的许可证政策。

工作流程:训练、部署与使用

SafeCoder 以服务、软件和支持的综合套餐形式交付。

自定义模型训练

客户可以选择一个训练阶段,在这一阶段,Hugging Face 团队将指导他们构建训练数据集并在其专有代码上微调模型。这将得到一个适应公司特定语言、标准和实践的模型,同时建立一个用于未来更新的管道,以避免供应商锁定。

部署与集成

Hugging Face 根据客户的特定基础设施构建经过吞吐量优化的硬件加速推理容器。上线后,开发者可通过与 VSCode 和 IntelliJ 兼容的 IDE 插件访问该助手。

可用性与 VMware 合作伙伴关系

SafeCoder 通过在 VMware Explore 大会上宣布的合作,向 VMware 企业客户提供。此合作伙伴关系使 SafeCoder 能够使用 VMware 的 Private AI 参考架构在 VMware Cloud 基础设施(本地、混合或云)上部署,该架构利用 Ray 和 Kubeflow 等工具在私有数据集旁边部署 AI 服务。

Sources