허깅페이스 스킬: AI 에이전트가 LLM을 미세 조정하도록 지원

허깅페이스는 허깅페이스 스킬을 출시했는데, 이는 클로드 코드, 오픈AI 코덱스, 구글 제미니 CLI와 같은 코딩 에이전트가 대형 언어 모델(LLM)의 미세 조정 엔드투엔드 프로세스를 자율적으로 관리할 수 있게 하는 프레임워크입니다. 단순히 스크립트를 작성하는 대신, 이러한 에이전트는 이제 데이터세트를 검증하고, 클라우드 GPU를 선택하고, 학습 작업을 제출하고, Trackio를 통해 진행 상황을 모니터링하며, 최종 모델을 허깅페이스 허브에 푸시할 수 있습니다.

자율적 미세 조정 워크플로

hf-llm-trainer 스킬을 갖춘 코딩 에이전트는 자연어 지시를 통해 전체 훈련 생명주기를 실행할 수 있습니다. 예를 들어, 특정 모델을 데이터세트에서 미세 조정하라는 요청은 다단계 자율 프로세스를 트리거합니다:

  1. 데이터세트 검증: 에이전트는 GPU 크레딧을 소비하기 전에 선택한 훈련 방법과의 호환성을 보장하기 위해 CPU에서 데이터세트 형식을 검사합니다.
  2. 하드웨어 선택: 에이전트는 모델 크기를 가장 비용 효율적인 GPU에 매핑합니다(예: 0.6B 파라미터 모델에 t4-small 선택).
  3. 작업 제출: 에이전트는 훈련 스크립트를 생성 및 업데이트하고, 허깅페이스 잡스에 작업을 제출하며, 사용자에게 작업 ID와 예상 비용을 제공합니다.
  4. 모니터링 및 디버깅: Trackio 통합을 사용하여 에이전트는 훈련 손실 및 학습률과 같은 실시간 메트릭을 보고할 수 있습니다. 오류가 발생하면, 예를 들어 메모리 부족(OOM) 문제의 경우, 에이전트는 배치 크기 감소 또는 하드웨어 업그레이드를 제안합니다.
  5. 배포: 완료되면 모델이 허깅페이스 허브에 자동으로 푸시됩니다.

지원되는 훈련 방법

이 프레임워크는 세 가지 주요 프로덕션 등급 훈련 방법론을 지원합니다:

감독 미세 조정 (SFT)

SFT는 고품질 시연 데이터(입력-출력 쌍)에서 모델을 훈련하는 데 사용됩니다. 3B 파라미터를 초과하는 모델의 경우, 에이전트는 메모리 요구 사항을 줄이기 위해 LoRA (저랭크 적응) 를 자동으로 사용하여 단일 GPU에서 7B 또는 13B 모델을 훈련할 수 있게 합니다.

직접 선호 최적화 (DPO)

DPO는 선호 쌍(선택됨 vs. 거부됨 응답)을 사용하여 모델 출력을 인간 선호도와 맞춥니다. 에이전트는 데이터세트에 필수적인 chosenrejected 열(또는 prompt 열)이 있는지 검증하고, 데이터세트가 다른 이름 규칙을 사용하는 경우 매핑 코드를 제공할 수 있습니다.

그룹 상대 정책 최적화 (GRPO)

GRPO는 수학 또는 코딩 문제와 같은 검증 가능한 작업에 최적화된 강화 학습 기법으로, 프로그램 기반 성공 기준을 가지고 있습니다(예: openai/gsm8k 데이터세트에서의 훈련).

하드웨어 매핑 및 비용 효율성

비용을 최적화하기 위해 에이전트는 모델 크기에 기반한 특정 GPU 매핑을 따릅니다:

모델 크기 추천 GPU 예상 비용 사용 사례
1B 미만 t4-small $1-2 교육/실험
1B - 3B t4-medium 또는 a10g-small $5-15 소규모 튜닝
3B - 7B a10g-large 또는 a100-large (LoRA와 함께) $15-40 프로덕션 튜닝

7B 파라미터를 초과하는 모델의 경우, 현재 HF 스킬 구현은 적합하지 않습니다.

로컬 배포 및 GGUF 변환

훈련 외에도, 에이전트는 llama.cpp, Ollama, 또는 LM Studio와 같은 도구를 통해 로컬 실행용 GGUF 포맷으로 미세 조정된 모델을 변환할 수 있습니다. 이 과정에는 LoRA 어댑터 병합, 양자화 적용(예: Q4_K_M), 그리고 양자화된 버전을 허브에 다시 푸시하는 것이 포함됩니다.

설정 및 호환성

이러한 스킬을 사용하려면 Jobs에 액세스하기 위해 Pro, Team, 또는 Enterprise 플랜이 있는 허깅페이스 계정이 필요합니다. 현재 이러한 스킬은 다음과 호환됩니다:

  • Claude Code: /plugin marketplace add huggingface/skills 를 통해 설치됩니다.
  • OpenAI Codex: AGENTS.md 파일을 통해 식별됩니다.
  • Gemini CLI: gemini extensions install 를 통해 설치됩니다.

Integrations for Cursor, Windsurf, and Continue are currently in development.

Sources