Hugging Face 模型在 Amazon Bedrock 市场

Hugging Face 开放模型现已在 Amazon Bedrock 上提供

Hugging Face 已宣布 Bedrock Marketplace 的启动,使 AWS 客户能够直接在 Amazon Bedrock 内部署 83 个流行的开放模型。此集成使开发者能够将开源模型的灵活性与 Amazon Bedrock 的完全托管基础设施相结合,包括与 Agents、知识库、防护栏和模型评估等高级服务的原生兼容性。

技术架构与集成

Bedrock Marketplace 模型端点在后台由 Amazon SageMaker JumpStart 提供支持。此架构使用户能够利用 SageMaker JumpStart 提供的部署便利性,同时使用 Amazon Bedrock 的托管基础设施和 API 生态系统。

部署方法

有两种主要途径可用于在 Amazon Bedrock 中部署开放模型:

  1. Bedrock Model Catalog: 用户可以通过在 Bedrock Model Catalog 中的任何可用区域(共 14 个)过滤“Hugging Face”提供商来搜索模型。
  2. Amazon SageMaker JumpStart: 用户可以通过 JumpStart 部署模型,随后将其注册到 Bedrock。

定价模型

在 Amazon Bedrock 中注册 SageMaker JumpStart 端点时,费用结构如下:

  • Compute: 用户需为托管模型所使用的底层 SageMaker 计算资源付费。
  • API Access: 标准的 Amazon Bedrock API 定价适用。

实施工作流:部署 Gemma 2 27B Instruct

为了演示此集成,Hugging Face 提供了部署 Google Gemma 2 27B Instruct 模型的工作流程:

1. 部署过程

  • Selection: 在 Bedrock Model Catalog 中定位 Google Gemma 2 27B Instruct。
  • Configuration: 选择端点名称、实例配置(例如,ml.g5.48xlarge),以及网络/服务角色设置。
  • Compliance: 接受模型提供商的最终用户许可协议(EULA)。
  • Execution: 将模型部署到用户的 Amazon SageMaker 租户。

2. 编程访问

部署后,模型可通过其端点 ARN 访问。开发者可以使用 AWS SDK(例如 Python 的 boto3)或 AWS CLI 调用模型。

使用 Bedrock Converse API 时,通过将 endpoint_arn 作为 modelId 传递来构建请求。这使得模型可以使用标准的 Bedrock 推理参数(例如 maxTokenstemperaturetopP)以及额外的模型特定字段(如 repetition_penaltytop_k)集成到应用程序中。

3. 资源管理

为了避免持续产生费用,用户必须在完成实验后,手动通过 Amazon Bedrock 控制台的“Marketplace deployments”页面删除端点。

Sources