Hetzner 推論 実験的 API

Hetzner 推論 実験的 API

Hetznerは現在、低コストAIホスティングの市場ニーズがあるかを確認し、負荷下でのシステムのスケーラビリティをテストするため、LLM推論サービスを試験的に提供しています。この提供は実験的であり、請求もSLAも保証もありません。

OpenAI互換 推論 API

Hetzner Inferenceは、Experimentsダッシュボードで生成されたAPIトークンを使ってHetznerのベースURLにOpenAIクライアントを向けることで、ユーザーがLLMを自分のアプリケーションに統合できるOpenAI互換APIを提供しています。

現在、このサービスでは単一のモデル Qwen/Qwen3.6-35B-A3B-FP8 を提供しています。これは30億のアクティブパラメータを持つ350億パラメータのMixture-of-Experts(MoE)モデルです。主な技術仕様は以下の通りです:

  • Capabilities: テキストと画像の両方の入力をサポートします。
  • Context Window: 262Kトークン。
  • Precision: FP8量子化された重みを使用します。

2026年7月23日に実施された初期テストでは、7つの短いリクエストにおける最初のトークンまでの中央値時間が153msで、512トークンに制限された長い生成では出力速度が1秒あたり224トークンでした。

効率的なホスティングの戦略的含意

このAPIの提供は、低コストかつ高効率なデータセンター運営というHetznerのコアコンピタンスを活かし、オープンウェイト推論を commoditize(商品化)する戦略を示唆しています。オープンウェイトモデルはさまざまなサービングソフトウェアで実行できるため、この市場における主な競争優位性は、競合他社よりも低コストでGPUハードウェアを運用できる能力にあります。

推論APIにより、Hetznerは複数のユーザー間で容量を共有することでGPUの利用率を最大化できます。これに対し、専用のベアメタルGPUサーバーは使用状況に関わらず単一の顧客にロックされます。このシフトにより、余剰GPU容量が安定した収益源になる可能性があります。

ハードウェアの制限とスケーリングの課題

Hetznerがハイエンド推論市場で競争できるかは、そのハードウェア投資にかかっています。Hetznerの現在の公開GPUラインナップはワークステーションクラスのGPUから構成されています:

  • NVIDIA RTX 4000 SFF Ada Generation (20 GB VRAM)
  • NVIDIA RTX PRO 6000 Blackwell Max-Q (96 GB VRAM)

これらは現在のQwenモデル(FP8重みで約38GB必要)には十分ですが、GLM-5のような巨大モデルには不十分です。GLM-5は何百ギガバイトものVRAMと高速インターコネクトを備えた密なマルチGPUシステム(B200/B300クラスのハードウェアなど)が必要です。Hetznerが主要な推論プロバイダーとして長期的に存続できるかは、ワークステーションGPUからエンタープライズクラスのGPUクラスターへ移行できるかどうかにかかっています。

コミュニティの視点

業界の観察者とユーザーは、ヨーロッパネイティブな推論プロバイダーに関するいくつかの潜在的な利点と懸念を指摘しています:

  • Regulatory Compliance: 高く評価されるEUネイティブプロバイダーは、米国または中国ベースのAIサービスの代替を求める企業のGDPR遵守を簡素化する可能性があります。
  • Market Commoditization: Hetznerの効率性により、小規模で有用なモデルの推論コストがゼロに近づくことを期待する声があり、これにより小規模な開発者にもAIがよりアクセスしやすくなるでしょう。
  • Regional Specialization: 一部では、米国が独自モデルをリードし、中国がオープンウェイトモデルをリードし、ヨーロッパが効率的な推論ホスティングを担当するという労働の分業が登場すると示唆しています。

"規制の神々を喜ばせるためだけでも、高く評価されるEUネイティブな推論プロバイダーが存在することは確かに興味深いでしょう。"

"私は、小規模で有用なモデルの推論コストがゆっくりと『close to zero』方向に向かう努力を支持します。"

Sources