Hugging Face SafeCoder 公告
TL;DR
Hugging Face 已推出 SafeCoder,这是一个面向企业的完整商业解决方案,用于部署自托管且完全合规的代码助手。它使公司能够在其自身的 Virtual Private Cloud (VPC) 中,使用自己的专有代码库微调并运行 Code 大型语言模型 (LLM),确保敏感知识产权永不离开其安全环境。
SafeCoder: 企业级代码助手
SafeCoder 不是一个独立的模型,而是一个端到端的商业解决方案,旨在提供 AI 编程伴侣的生产力优势,同时消除与闭源 LLM 相关的安全和合规风险。
Key characteristics of the SafeCoder solution include:
- Self-Hosting: 专为在客户自身基础设施上部署而设计。
- Data Sovereignty: 在训练或推理阶段,代码永不会离开客户的 VPC。
- Ownership: 客户拥有其生成的微调 Code LLM。
- Hardware Flexibility: 支持广泛的加速器,包括 NVIDIA Ampere GPU、AMD Instinct GPU、Habana Gaudi2、AWS Inferentia 2 和 Intel Xeon Sapphire Rapids CPU。
技术基础:StarCoder 系列
SafeCoder 的初始版本由 BigCode 项目开发的 StarCoder 模型系列提供支持(这是 Hugging Face、ServiceNow 和开源社区的合作项目)。
StarCoder 为企业使用提供了几个技术优势:
- Performance: 一个 15B 参数的模型,针对推理进行了优化,使用 Multi-Query Attention(减少内存占用)和 Flash Attention(可扩展至 8,192 token 上下文)。
- Ethical Sourcing: 在 “The Stack” 上进行训练,该数据集仅包含商业上允许的许可代码,内置了开发者退出机制、PII 删除和去重。
- Adaptability: 由于其建立在开源基础之上,SafeCoder 可以随着新版更强大的开源模型的出现而进行更新以利用这些模型。
隐私、安全与合规
SafeCoder 解决了企业在采用 AI 编程助手时面临的主要障碍:在微调或推理过程中泄露专有代码的风险。
隐私与安全实现
在设置阶段,Hugging Face 提供了客户准备和去标识内部代码库以形成训练数据集所需的容器、脚本和示例。此训练在 Hugging Face 提供的、配置为客户自身硬件的容器内进行。对于部署,Hugging Face 提供了暴露在客户 VPC 内的私有端点的推理容器。
合规与法律风险缓解
SafeCoder 利用 BigScience 和 BigCode 的合规工作来最小化法律风险。具体来说,SafeCoder 生成的代码补全将与 The Stack 进行核对。这使用户能够识别建议的代码是否与现有源数据匹配,并验证相关许可证,使客户能够执行其首选的许可证政策。
工作流程:训练、部署与使用
SafeCoder 以服务、软件和支持的综合套餐形式交付。
自定义模型训练
客户可以选择一个训练阶段,在这一阶段,Hugging Face 团队将指导他们构建训练数据集并在其专有代码上微调模型。这将得到一个适应公司特定语言、标准和实践的模型,同时建立一个用于未来更新的管道,以避免供应商锁定。
部署与集成
Hugging Face 根据客户的特定基础设施构建经过吞吐量优化的硬件加速推理容器。上线后,开发者可通过与 VSCode 和 IntelliJ 兼容的 IDE 插件访问该助手。
可用性与 VMware 合作伙伴关系
SafeCoder 通过在 VMware Explore 大会上宣布的合作,向 VMware 企业客户提供。此合作伙伴关系使 SafeCoder 能够使用 VMware 的 Private AI 参考架构在 VMware Cloud 基础设施(本地、混合或云)上部署,该架构利用 Ray 和 Kubeflow 等工具在私有数据集旁边部署 AI 服务。
Sources
- OriginalIntroducing SafeCoder