허깅페이스 스킬: AI 에이전트가 LLM을 미세 조정하도록 지원
허깅페이스는 허깅페이스 스킬을 출시했는데, 이는 클로드 코드, 오픈AI 코덱스, 구글 제미니 CLI와 같은 코딩 에이전트가 대형 언어 모델(LLM)의 미세 조정 엔드투엔드 프로세스를 자율적으로 관리할 수 있게 하는 프레임워크입니다. 단순히 스크립트를 작성하는 대신, 이러한 에이전트는 이제 데이터세트를 검증하고, 클라우드 GPU를 선택하고, 학습 작업을 제출하고, Trackio를 통해 진행 상황을 모니터링하며, 최종 모델을 허깅페이스 허브에 푸시할 수 있습니다.
자율적 미세 조정 워크플로
hf-llm-trainer 스킬을 갖춘 코딩 에이전트는 자연어 지시를 통해 전체 훈련 생명주기를 실행할 수 있습니다. 예를 들어, 특정 모델을 데이터세트에서 미세 조정하라는 요청은 다단계 자율 프로세스를 트리거합니다:
- 데이터세트 검증: 에이전트는 GPU 크레딧을 소비하기 전에 선택한 훈련 방법과의 호환성을 보장하기 위해 CPU에서 데이터세트 형식을 검사합니다.
- 하드웨어 선택: 에이전트는 모델 크기를 가장 비용 효율적인 GPU에 매핑합니다(예: 0.6B 파라미터 모델에
t4-small선택). - 작업 제출: 에이전트는 훈련 스크립트를 생성 및 업데이트하고, 허깅페이스 잡스에 작업을 제출하며, 사용자에게 작업 ID와 예상 비용을 제공합니다.
- 모니터링 및 디버깅: Trackio 통합을 사용하여 에이전트는 훈련 손실 및 학습률과 같은 실시간 메트릭을 보고할 수 있습니다. 오류가 발생하면, 예를 들어 메모리 부족(OOM) 문제의 경우, 에이전트는 배치 크기 감소 또는 하드웨어 업그레이드를 제안합니다.
- 배포: 완료되면 모델이 허깅페이스 허브에 자동으로 푸시됩니다.
지원되는 훈련 방법
이 프레임워크는 세 가지 주요 프로덕션 등급 훈련 방법론을 지원합니다:
감독 미세 조정 (SFT)
SFT는 고품질 시연 데이터(입력-출력 쌍)에서 모델을 훈련하는 데 사용됩니다. 3B 파라미터를 초과하는 모델의 경우, 에이전트는 메모리 요구 사항을 줄이기 위해 LoRA (저랭크 적응) 를 자동으로 사용하여 단일 GPU에서 7B 또는 13B 모델을 훈련할 수 있게 합니다.
직접 선호 최적화 (DPO)
DPO는 선호 쌍(선택됨 vs. 거부됨 응답)을 사용하여 모델 출력을 인간 선호도와 맞춥니다. 에이전트는 데이터세트에 필수적인 chosen 및 rejected 열(또는 prompt 열)이 있는지 검증하고, 데이터세트가 다른 이름 규칙을 사용하는 경우 매핑 코드를 제공할 수 있습니다.
그룹 상대 정책 최적화 (GRPO)
GRPO는 수학 또는 코딩 문제와 같은 검증 가능한 작업에 최적화된 강화 학습 기법으로, 프로그램 기반 성공 기준을 가지고 있습니다(예: openai/gsm8k 데이터세트에서의 훈련).
하드웨어 매핑 및 비용 효율성
비용을 최적화하기 위해 에이전트는 모델 크기에 기반한 특정 GPU 매핑을 따릅니다:
| 모델 크기 | 추천 GPU | 예상 비용 | 사용 사례 |
|---|---|---|---|
| 1B 미만 | t4-small |
$1-2 | 교육/실험 |
| 1B - 3B | t4-medium 또는 a10g-small |
$5-15 | 소규모 튜닝 |
| 3B - 7B | a10g-large 또는 a100-large (LoRA와 함께) |
$15-40 | 프로덕션 튜닝 |
7B 파라미터를 초과하는 모델의 경우, 현재 HF 스킬 구현은 적합하지 않습니다.
로컬 배포 및 GGUF 변환
훈련 외에도, 에이전트는 llama.cpp, Ollama, 또는 LM Studio와 같은 도구를 통해 로컬 실행용 GGUF 포맷으로 미세 조정된 모델을 변환할 수 있습니다. 이 과정에는 LoRA 어댑터 병합, 양자화 적용(예: Q4_K_M), 그리고 양자화된 버전을 허브에 다시 푸시하는 것이 포함됩니다.
설정 및 호환성
이러한 스킬을 사용하려면 Jobs에 액세스하기 위해 Pro, Team, 또는 Enterprise 플랜이 있는 허깅페이스 계정이 필요합니다. 현재 이러한 스킬은 다음과 호환됩니다:
- Claude Code:
/plugin marketplace add huggingface/skills를 통해 설치됩니다. - OpenAI Codex:
AGENTS.md파일을 통해 식별됩니다. - Gemini CLI:
gemini extensions install를 통해 설치됩니다.
Integrations for Cursor, Windsurf, and Continue are currently in development.