Hugging Face 专业版推理

Hugging Face 已推出 专业版推理,这是一项社区提供的服务,为专业版用户提供访问经过策划的超快速 API 端点的权限,以使用高性能模型。此服务旨在促进快速实验和原型制作,而无需用户自行管理基础设施。

加速访问最先进模型

专业版推理为经过策划的强大模型列表提供由 text-generation-inference (TGI) 驱动的独占 API 端点。虽然免费推理 API 仍然对所有用户开放,用于测试 200,000+ 模型,但专业版用户享有更高的速率限制以及对特定高性能模型的访问权限。

支持的模型和功能

模型 大小 上下文长度 主要用途
Meta Llama 3 Instruct 8B, 70B 8k 标记 聊天
Mixtral 8x7B Instruct 45B MOE 32k 标记 高性能聊天
Nous Hermes 2 Mixtral 8x7B DPO 45B MOE 32k 标记 高级 Mixtral 调优
Zephyr 7B β 7B 4k 标记 聊天 (7B 权重)
Llama 2 Chat 7B, 13B 4k 标记 对话式 AI
Mistral 7B Instruct v0.2 7B 4k 标记 聊天 (7B 权重)
Code Llama Base 7B, 13B 4k 标记 代码自动补全/填充
Code Llama Instruct 34B 16k 标记 对话式代码助手
Stable Diffusion XL 3B UNet - 图像生成
Bark 0.9B - 文本到音频生成

技术实现与集成

集成通过使用 PRO 账户身份验证令牌向模型的 API 端点发送 HTTP POST 请求来实现。开发者可以使用 curl 或来自 huggingface_hub Python 库的 InferenceClient 实用工具进行流畅访问。

Messages API 与 OpenAI 兼容性

所有文本生成模型现在支持 消息 API,使其与 OpenAI 客户端库以及 LangChain 和 LlamaIndex 等框架兼容。这使开发者能够通过将 base_url 指向 https://api-inference.huggingface.co/v1/ 来使用 openai Python 客户端。

高级生成控制

用户可以使用以下几个生成参数来微调模型输出:

  • 文本生成:
    • do_sample:在确定性贪婪搜索 (False) 和概率采样 (True) 之间切换。
    • temperature:控制变化;较低值推荐用于代码,较高值推荐用于开放式文本。
    • top_ktop_p:将采样池限制为最可能的标记。
    • repetition_penalty:降低重复词出现的可能性。
    • max_new_tokens:设置生成序列的最大长度。
  • 图像生成 (SDXL):
    • negative_prompt:定义要从图像中排除的内容。
    • guidance_scale:控制模型遵循提示的严格程度。
    • num_inference_steps:确定去噪步骤的数量(通常为 20-50)。

专用推理任务

代码填充

使用 Code Llama,用户可以通过提供前缀和后缀序列来执行“填充”。模型使用以下格式预测应该放置在这两者之间的内容:<PRE> {prefix} <SUF>{suffix} <MID>

令牌流式传输

为了降低感知延迟并提升用户体验,API 支持令牌流式传输。通过在 InferenceClient 中传递 stream=True 或在使用 curl 时加入 -N 标记,令牌将在生成时逐个返回。

缓存

最近的结果会默认缓存以提高性能。无论采样设置如何,用户可以在请求中添加 HTTP 头 x-use-cache: 0 以强制进行全新生成。

使用建议

专业版推理旨在用于实验和原型制作。对于重型生产应用,Hugging Face 建议使用 推理端点,它们提供专用基础设施。

Sources