Hetzner 推論實驗 API

Hetzner 推論實驗 API

Hetzner 目前正在實驗一項 LLM 推論服務,以確定是否存在低成本 AI 託管的市場需求,並測試該系統在負載下的擴縮方式。這是一項實驗性提供,無計費、無 SLA,亦無生產保證。

OpenAI 相容推論 API

Hetzner Inference 提供一個 OpenAI 相容的 API,讓使用者透過使用 Experiments 儀表板產生的 API 權杖,將 OpenAI 客戶端指向 Hetzner 的基礎 URL,從而在他們的應用程式中整合 LLM。

目前,該服務僅提供單一模型:Qwen/Qwen3.6-35B-A3B-FP8。這是一個具有 35 億參數的混合專家(MoE)模型,擁有 3 億個活躍參數。關鍵技術規格包括:

  • Capabilities:同時支援文字和圖像輸入。
  • Context Window:262K 個 token。
  • Precision:使用 FP8 量化權重。

初步測試於 2026 年 7 月 23 日進行,顯示在七個短請求中首個 token 的中位數時間為 153 毫秒,而較長生成(上限 512 個 token)的輸出速度為每秒 224 個 token。

高效託管的戰略含義

此 API 的推出顯示出一種策略:利用 Hetzner 在低成本、高效率資料中心運營方面的核心競爭力,將開放權重的推論商品化。由於開放權重模型可以在各種服務軟體上運行,此市場的主要競爭優勢在於能夠以低於競爭對手的成本運營 GPU 硬體。

推論 API 讓 Hetzner 能透過在多個使用者間共享容量來最大化 GPU 利用率;相對地,專用裸金屬 GPU 伺服器則被鎖定在單一客戶,無論使用程度如何。此轉變可能將閒置的 GPU 容量轉化為穩定的收入來源。

硬體限制與擴展挑戰

Hetzner 是否能在高端推論市場中競爭,取決於其硬體投資。Hetzner 目前公開的 GPU 陣容由工作站級 GPU 組成:

  • NVIDIA RTX 4000 SFF Ada Generation (20 GB VRAM)
  • NVIDIA RTX PRO 6000 Blackwell Max-Q (96 GB VRAM)

雖然這些 GPU 對於目前的 Qwen 模型(約需 38 GB 來存放 FP8 權重)已足夠,但對於像 GLM-5 這樣的巨型模型則不足,後者需要數百 GB 的顯存以及密集的多 GPU 系統(如 B200/B300 級硬體)和高速互連。Hetzner 作為主要推論提供者的長期可行性,取決於他們是否能超越工作站 GPU,轉向企業級 GPU 集群。

社區觀點

業界觀察者和使用者已指出,就歐洲本土推論提供者而言,存在幾項潛在優勢與關注點:

  • Regulatory Compliance:備受尊敬的歐洲本土提供者可簡化尋求美國或中國以外 AI 服務替代方案的公司的 GDPR 合規性。
  • Market Commoditization:人們希望 Hetzner 的效率能將較小且實用模型的推論成本推向零,使 AI 對較小開發者更具可及性。
  • Regional Specialization:有人提出,美國將領導專有模型,中國將領導開放權重模型,而歐洲將專注於高效推論託管,從而形成新興的勞動分工。

"擁有一個備受尊敬的歐洲本土推論提供者肯定會很有趣,只要能讓監管之神感到滿意即可。" "我贊同努力讓較小且實用模型的推論成本慢慢接近『接近零』的目標。"

SUMMARY: Hetzner 正在實驗一個 OpenAI 相容的 LLM 推論 API,以測試擴縮性和低成本、高效率 AI 託管的市場需求。

TITLE: Hetzner 推論實驗 API

Sources