Hugging Face OpenClaw 마이그레이션 가이드

Hugging Face는 Anthropic이 Pro/Max 구독자를 위한 오픈 에이전트 플랫폼에서 Claude 모델 접근을 제한하기로 한 결정에 따라 사용자가 OpenClaw, Pi 또는 Open Code 에이전트를 오픈소스 모델로 마이그레이션하도록 돕는 가이드를 소개했습니다.

OpenClaw 에이전트를 위한 마이그레이션 옵션

사용자는 Hugging Face Inference Providers를 통한 호스팅 오픈 모델을 선택하거나 자체 하드웨어에서 모델을 로컬로 실행하여 에이전트 기능을 복원할 수 있습니다.

Hugging Face Inference Providers

Inference Providers는 특히 로컬에서 모델을 실행할 하드웨어가 부족한 사용자에게 에이전트 기능을 복원하는 가장 빠른 경로를 제공합니다. 이 플랫폼은 오픈소스 모델 제공업체에 요청을 라우팅합니다.

설정 과정:

  1. 설정에서 Hugging Face 토큰을 생성합니다.
  2. 다음 명령을 사용하여 연결을 초기화합니다: openclaw onboard --auth-choice huggingface-api-key.
  3. 프롬프트가 나타나면 모델을 선택합니다. Hugging Face는 터미널 벤치에서 높은 성능을 보이는 GLM-5를 권장합니다.

구성: 사용자는 OpenClaw 구성 파일에서 repo_id를 지정하여 모델을 업데이트할 수 있습니다:

{
  "agents": {
    "defaults": {
      "model": {
        "primary": "huggingface/zai-org/GLM-5:fastest"
      }
    }
  }
}

HF PRO 구독자는 Inference Providers 사용에 대해 매월 $2의 무료 크레딧을 받습니다.

llama.cpp 로컬 모델 설정

설치:

  • macOS/Linux: brew install llama.cpp
  • Windows: winget install llama.cpp

실행: 사용자는 다음과 같은 명령을 사용하여 내장 웹 UI가 포함된 로컬 서버를 시작할 수 있습니다:

llama-server -hf unsloth/Qwen3.5-35B-A3B-GGUF:UD-Q4_K_XL

이 특정 모델 (Qwen3.5-35B-A3B)에는 32GB RAM을 권장합니다. 사용자는 Hugging Face Hub에서 수천 개의 GGUF 모델을 탐색하여 하드웨어와 호환되는 모델을 찾을 수 있습니다.

OpenClaw 통합: OpenClaw를 로컬 llama.cpp 인스턴스에 연결하려면 다음 구성 명령을 사용합니다:

openclaw onboard --non-interactive \
   --auth-choice custom-api-key \
   --custom-base-url "http://127.0.0.1:8080/v1" \
   --custom-model-id "unsloth-qwen3.5-35b-a3b-gguf" \
   --custom-api-key "llama.cpp" \
   --secret-input-mode plaintext \
   --custom-compatibility openai

검증은 curl을 통해 수행할 수 있습니다: curl http://127.0.0.1:8080/v1/models.

비교: 호스팅 vs. 로컬 배포

기능 Hugging Face Inference Providers 로컬 설정 (llama.cpp)
설정 속도 가장 빠름 느림
비용 API 기반 (일부 무료 크레딧 포함) API 비용 없음
프라이버시 제공자 호스팅 완전 로컬 제어
하드웨어 로컬 하드웨어 불필요 호환 가능한 하드웨어 필요
속도 제한 제공자 제한 적용 속도 제한 없음

Sources