Hugging Face SafeCoder 公告

TL;DR

Hugging Face 已推出 SafeCoder,一個完整的商業解決方案,供企業部署自託管且完全合規的程式碼助理。它使公司能夠在其自身的 Virtual Private Cloud (VPC) 中,對其專有程式碼基礎進行微調並運行 Code 大型語言模型 (LLMs),確保敏感的智慧財產永不離開其安全環境。

SafeCoder: 企業級程式碼助理

SafeCoder 不是一個獨立的模型,而是一個端到端的商業解決方案,旨在提供 AI 結對程式設計師的生產力優勢,同時消除與閉源 LLMs 相關的安全與合規風險。

Key characteristics of the SafeCoder solution include:

  • Self-Hosting: 設計為在客戶自身基礎設施上部署。
  • Data Sovereignty: 程式碼在訓練或推理階段永不會離開客戶的 VPC。
  • Ownership: 客戶擁有其所得到的經微調的 Code LLM。
  • Hardware Flexibility: 支援廣泛的加速器,包括 NVIDIA Ampere GPUs、AMD Instinct GPUs、Habana Gaudi2、AWS Inferentia 2 和 Intel Xeon Sapphire Rapids CPUs。

技術基礎:StarCoder 系列

SafeCoder 的初始版本由 StarCoder 模型系列提供動力,該系列由 BigCode 專案開發(Hugging Face、ServiceNow 與開源社區的合作)。

StarCoder 為企業使用提供了幾項技術優勢:

  • Performance: 一個 15B 參數模型,針對推理進行優化,採用 Multi-Query Attention(減少記憶體佔用)和 Flash Attention(擴展至 8,192 個 token 的上下文)。
  • Ethical Sourcing: 在「The Stack」上進行訓練,該資料集僅包含商業上允許的授權程式碼,內建開發者退出機制、PII 移除及去重複。
  • Adaptability: 由於其建構在開源基礎上,SafeCoder 可以隨著更新而使用更新、更強大的開源模型。

隱私、安全與合規

SafeCoder 解決了企業在採用 AI 程式碼助理時面臨的主要障礙:在微調或推理過程中洩漏專有程式碼的風險。

隱私與安全實作

在設置階段,Hugging Face 提供客戶準備並去識別其內部程式碼基礎以建立訓練資料集所需的容器、腳本和範例。此訓練在 Hugging Face 提供的容器中進行,該容器已配置為客戶自己的硬體。就部署而言,Hugging Face 提供推理容器,該容器會在客戶的 VPC 內暴露私有端點。

合規與法律風險降低

SafeCoder 利用 BigScience 和 BigCode 的合規工作來降低法律風險。具體來說,SafeCoder 產生的程式碼補全會與 The Stack 進行比對。這使得使用者能夠辨識建議的程式碼是否與現有來源資料匹配,並驗證相關授權,從而讓客戶能夠執行其偏好的授權政策。

工作流程:訓練、部署與使用

SafeCoder 作為一個涵蓋服務、軟體與支援的綜合套件提供。

自訂模型訓練

客戶可以選擇訓練階段,在該階段中,Hugging Face 團隊將引導他們構建訓練資料集,並在其專有程式碼上微調模型。這將產生一個適應公司特定語言、標準與實務的模型,同時建立未來更新的管道,以避免供應商鎖定。

部署與整合

Hugging Face 會根據客戶特定的基礎設施,建置針對吞吐量進行優化的硬體加速推理容器。上線後,開發者可透過與 VSCode 和 IntelliJ 相容的 IDE 外掛程式存取該助理。

可用性與 VMware 合作夥伴

SafeCoder 透過在 VMware Explore 大會上宣布的合作,向 VMware 企業客戶提供。此合作夥伴關係使 SafeCoder 能夠使用 VMware 的 Private AI Reference Architecture 部署在 VMware Cloud 基礎設施上(內部、混合或雲端),該架構利用如 Ray 和 Kubeflow 等工具,在私有資料集旁邊部署 AI 服務。

Sources