Hetzner 推論實驗 API
Hetzner 目前正在實驗一項 LLM 推論服務,以確定是否存在低成本 AI 託管的市場需求,並測試該系統在負載下的擴縮方式。這是一項實驗性提供,無計費、無 SLA,亦無生產保證。
OpenAI 相容推論 API
Hetzner Inference 提供一個 OpenAI 相容的 API,讓使用者透過使用 Experiments 儀表板產生的 API 權杖,將 OpenAI 客戶端指向 Hetzner 的基礎 URL,從而在他們的應用程式中整合 LLM。
目前,該服務僅提供單一模型:Qwen/Qwen3.6-35B-A3B-FP8。這是一個具有 35 億參數的混合專家(MoE)模型,擁有 3 億個活躍參數。關鍵技術規格包括:
- Capabilities:同時支援文字和圖像輸入。
- Context Window:262K 個 token。
- Precision:使用 FP8 量化權重。
初步測試於 2026 年 7 月 23 日進行,顯示在七個短請求中首個 token 的中位數時間為 153 毫秒,而較長生成(上限 512 個 token)的輸出速度為每秒 224 個 token。
高效託管的戰略含義
此 API 的推出顯示出一種策略:利用 Hetzner 在低成本、高效率資料中心運營方面的核心競爭力,將開放權重的推論商品化。由於開放權重模型可以在各種服務軟體上運行,此市場的主要競爭優勢在於能夠以低於競爭對手的成本運營 GPU 硬體。
推論 API 讓 Hetzner 能透過在多個使用者間共享容量來最大化 GPU 利用率;相對地,專用裸金屬 GPU 伺服器則被鎖定在單一客戶,無論使用程度如何。此轉變可能將閒置的 GPU 容量轉化為穩定的收入來源。
硬體限制與擴展挑戰
Hetzner 是否能在高端推論市場中競爭,取決於其硬體投資。Hetzner 目前公開的 GPU 陣容由工作站級 GPU 組成:
- NVIDIA RTX 4000 SFF Ada Generation (20 GB VRAM)
- NVIDIA RTX PRO 6000 Blackwell Max-Q (96 GB VRAM)
雖然這些 GPU 對於目前的 Qwen 模型(約需 38 GB 來存放 FP8 權重)已足夠,但對於像 GLM-5 這樣的巨型模型則不足,後者需要數百 GB 的顯存以及密集的多 GPU 系統(如 B200/B300 級硬體)和高速互連。Hetzner 作為主要推論提供者的長期可行性,取決於他們是否能超越工作站 GPU,轉向企業級 GPU 集群。
社區觀點
業界觀察者和使用者已指出,就歐洲本土推論提供者而言,存在幾項潛在優勢與關注點:
- Regulatory Compliance:備受尊敬的歐洲本土提供者可簡化尋求美國或中國以外 AI 服務替代方案的公司的 GDPR 合規性。
- Market Commoditization:人們希望 Hetzner 的效率能將較小且實用模型的推論成本推向零,使 AI 對較小開發者更具可及性。
- Regional Specialization:有人提出,美國將領導專有模型,中國將領導開放權重模型,而歐洲將專注於高效推論託管,從而形成新興的勞動分工。
"擁有一個備受尊敬的歐洲本土推論提供者肯定會很有趣,只要能讓監管之神感到滿意即可。" "我贊同努力讓較小且實用模型的推論成本慢慢接近『接近零』的目標。"
SUMMARY: Hetzner 正在實驗一個 OpenAI 相容的 LLM 推論 API,以測試擴縮性和低成本、高效率 AI 託管的市場需求。
TITLE: Hetzner 推論實驗 API
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- 專案
- Dispatch