Hetzner 推理实验 API
Hetzner 推理实验 API
Hetzner 目前正在尝试一个 LLM 推理服务,以确定是否存在低成本 AI 托管的市场需求,并测试该系统在负载下的扩展性。这是一个实验性产品,没有计费,没有 SLA,也没有生产保证。
OpenAI 兼容推理 API
Hetzner 推理提供一个 OpenAI 兼容的 API,使用户能够通过将 OpenAI 客户端指向 Hetzner 的基础 URL(使用通过 Experiments 仪表板生成的 API 令牌)将 LLMs 集成到他们的应用程序中。
目前,该服务仅提供一个模型:Qwen/Qwen3.6-35B-A3B-FP8。这是一个具有 350 亿参数的混合专家(MoE)模型,其中有 30 亿活跃参数。关键技术规格包括:
- Capabilities: 支持文本和图像输入。
- Context Window: 262K tokens。
- Precision: 使用 FP8-量化权重。
初步测试 conducted on July 23, 2026, showed a median time to first token of 153 ms across seven short requests and an output speed of 224 tokens per second for longer generations capped at 512 tokens.
高效托管的战略意义
此 API 的推出表明了一种策略:利用 Hetzner 在低成本、高效率数据中心运营方面的核心竞争力,将开放权重推理商品化。由于开放权重模型可以在各种服务软件上运行,因此此市场的主要竞争优势在于以低于竞争对手的成本运行 GPU 硬件的能力。
推理 API 使 Hetzner 能够通过在多个用户之间共享容量来最大化 GPU 利用率,而专用裸金属 GPU 服务器则无论使用程度如何都被锁定给单个客户端。这一转变可能将闲置的 GPU 容量转化为稳定的收入来源。
硬件限制与扩展挑战
Hetzner 是否能够在高端推理市场竞争取决于其硬件投资。Hetzner 当前的公开 GPU 产品线由工作站级 GPU 组成:
- NVIDIA RTX 4000 SFF Ada Generation (20 GB 显存)
- NVIDIA RTX PRO 6000 Blackwell Max-Q (96 GB 显存)
虽然这些对于当前的 Qwen 模型已经足够(FP8 权重大约需要 38 GB),但它们不足以支持像 GLM-5 这样的大型模型,后者需要数百 GB 的显存以及密集的多 GPU 系统(如 B200/B300 级硬件)和高速互连。Hetzner 作为主要推理提供商的长期可行性取决于他们是否能够超越工作站 GPU,转向企业级 GPU 集群。
社区观点
行业观察者和用户已经指出了关于欧洲本地推理提供商的几个潜在优势和担忧:
- Regulatory Compliance: 一位备受尊敬的欧盟本地提供商可以简化寻求美国或中国 AI 服务替代方案的公司的 GDPR 合规性。
- Market Commoditization: 人们希望 Hetzner 的效率能够推动较小、有用模型的推理成本趋近于零,从而让更多小型开发者能够使用 AI。
- Regional Specialization: 一些人提出了一种新兴的劳动分工:美国领导专有模型,中国领导开放权重模型,欧洲领导高效推理托管。
"拥有一个备受尊敬的欧盟本地推理提供商肯定会很有趣,只要能让监管之神满意即可"
"我赞同努力让较小有用模型的推理成本慢慢接近'接近零'"