Hetzner 추론 실험 API

Hetzner 추론 실험 API

Hetzner는 현재 저비용 AI 호스팅에 대한 시장 수요를 파악하고 해당 시스템이 부하 하에서 어떻게 확장되는지 테스트하기 위해 LLM 추론 서비스를 실험 중입니다. 이 서비스는 청구금액, SLA, 생산 보장이 없는 실험적 제공입니다.

OpenAI 호환 추론 API

Hetzner 추론은 Experiments 대시보드를 통해 생성된 API 토큰을 사용하여 Hetzner의 기본 URL을 가리키는 OpenAI 클라이언트를 통해 사용자가 자신의 애플리케이션에 LLM을 통합할 수 있도록 OpenAI 호환 API를 제공합니다.

현재 이 서비스는 단일 모델만 제공합니다: Qwen/Qwen3.6-35B-A3B-FP8. 이는 30억 개의 활성 파라미터를 가진 350억 파라미터 Mixture-of-Experts(MoE) 모델입니다. 주요 기술 사양은 다음과 같습니다:

  • 기능: 텍스트와 이미지 입력을 모두 지원합니다.
  • 컨텍스트 윈도우: 262K 토큰.
  • 정밀도: FP8 양자화된 가중치를 사용합니다.

2026년 7월 23일에 수행된 초기 테스트에서, 7개의 짧은 요청에 대한 첫 토큰까지의 중간 시간이 153 ms였고, 512 토큰으로 제한된 더 긴 생성에 대한 출력 속도는 초당 224 토큰이었습니다.

효율적인 호스팅의 전략적 함의

이 API의 출시는 저비용, 고효율 데이터 센터 운영이라는 Hetzner의 핵심 역량을 활용하여 오픈-웨이트 추론을 상품화하는 전략을 시사합니다. 오픈-웨이트 모델은 다양한 서빙 소프트웨어에서 실행될 수 있기 때문에, 이 시장에서 주요 경쟁 우위는 경쟁사보다 낮은 비용으로 GPU 하드웨어를 운영할 수 있는 능력입니다.

추론 API는 여러 사용자 간에 용량을 공유함으로써 Hetzner가 GPU 활용도를 극대화할 수 있게 해줍니다. 반면, 전용 베어메탈 GPU 서버는 사용량과 관계없이 단일 고객에 고정됩니다. 이러한 변화는 여분 GPU 용량을 꾸준한 수익원으로 전환할 수 있습니다.

하드웨어 제한 및 확장 도전 과제

Hetzner가 고급 추론 시장에서 경쟁할 수 있는지 여부는 하드웨어 투자에 달려 있습니다. Hetzner의 현재 공개된 GPU 라인업은 워크스테이션급 GPU로 구성되어 있습니다:

  • NVIDIA RTX 4000 SFF Ada Generation (20 GB VRAM)
  • NVIDIA RTX PRO 6000 Blackwell Max-Q (96 GB VRAM)

これらは 현재 Qwen 모델에 충분합니다(FP8 가중치에 약 38 GB가 필요함). 그러나 이들은 GLM-5와 같은巨大 모델에 부족합니다. GLM-5는 수백 기가바이트의 VRAM과 고속 인터커넥트를 갖춘 dense multi-GPU 시스템(B200/B300-class 하드웨어 등)이 필요합니다. Hetzner가 주요 추론 제공자로서 장기적으로 생존 가능성은 워크스테이션 GPU를 넘어 기업급 GPU 클러스터로 이동하는지에 달려 있습니다.

커뮤니티 관점

산업 관찰자들과 사용자들은 유럽 토착 추론 제공자에 대한 여러 잠재적 장점과 우려를 강조했습니다:

  • 규제 준수: 높이 평가받는 EU 토착 제공자는 미국 또는 중국 기반 AI 서비스의 대안을 찾는 기업들의 GDPR 준수를 간소화할 수 있습니다.
  • 시장 상품화: Hetzner의 효율성이 더 작은 유용한 모델에 대한 추론 비용을 zéro에 가깝게 낮출 것이라는 기대가 있으며,これにより 소규모 개발자에게 AI가 더 접근 가능해집니다.
  • 지역 전문화: 일부에서는 미국이 독점 모델을リード하고, 중국이 오픈-웨이트 모델을リード하며, 유럽이 효율적인 추론 호스팅을リード하는 노동 분업이 émerging 중이라고 제안합니다.

"규제 신들을 기쁘게 하기만 하더라도, 높이 평가받는 EU 토착 추론 제공자를 갖는 것은 확실히 흥미로울 것입니다.

"나는 더 작은 유용한 모델에 대한 추론 비용이 천천히 'close to zero'에 접근하도록 하는 노력을 지지합니다."} , {"summary": "Hetzner는 저비용, 효율적인 AI 호스팅에 대한 확장성 및 시장 수요를 테스트하기 위해 OpenAI 호환 LLM 추론 API를 실험 중입니다."} , {"title": "Hetzner 추론 실험 API"}]} (this is the final output){

Sources