Prodigy-HF 통합 릴리스 노트
Explosion은 Prodigy-HF를 도입했는데, 이는 Prodigy 주석 도구와 Hugging Face 생태계를 통합하는 플러그인입니다. 이 통합을 통해 사용자는 주석이 달린 데이터에서 직접 트랜스포머 모델을 미세 조정하고 Hugging Face Hub에 데이터셋을 게시할 수 있어 데이터 라벨링과 모델 훈련 사이의 워크플로를 간소화합니다.
모델 훈련 및 재사용
Prodigy-HF는 Prodigy 인터페이스 내에 주석이 달린 데이터를 사용하여 Hugging Face 모델의 훈련과 재사용을 가능하게 합니다. Hugging Face transformers 라이브러리의 AutoTokenizer 및 AutoModel 클래스와 통합함으로써, 이 플러그인은 Hugging Face Hub에서 사용할 수 있는 모든 트랜스포머 모델을 단일 명령줄 인터페이스를 통해 미세 조정할 수 있게 합니다.
명명된 엔티티 인식 (NER)
사용자는 hf.train.ner 레시피를 사용하여 NER 작업에 대한 트랜스포머 모델을 미세 조정할 수 있습니다. 예를 들어, 특정 데이터셋에서 distilbert-base-uncased 모델을 훈련하는 것은 다음 명령어로 수행됩니다:
python -m prodigy hf.train.ner fashion-train,eval:fashion-eval path/to/model-out --model "distilbert-base-uncased"
훈련이 완료되면, 이러한 모델은 hf.correct.ner 레시피를 통해 추가 주석 작업을 지원하는 데 사용될 수 있으며, 이는 Prodigy 인터페이스 내에서 모델 예측을 직접 표시하여 라벨링 프로세스를 가속화합니다.
텍스트 분류
NER용 파이프라인과 유사하게, 이 플러그인은 hf.train.textcat 레시피를 통해 텍스트 분류를 지원합니다:
python -m prodigy hf.train.textcat fashion-train,eval:fashion-eval path/to/model-out --model "distilbert-base-uncased"
Hugging Face Hub에 데이터셋 게시
Prodigy-HF는 Hugging Face Hub에 주석이 달린 데이터셋을 직접 게시하는 기능을 포함합니다. 이를 통해 사용자는 더 넓은 커뮤니티와 자신만의 맞춤형 데이터셋을 공유하여 협업을 촉진할 수 있습니다.
업로드 프로세스는 다음 명령어로 처리됩니다:
python -m prodigy hf.upload <dataset_name> <username>/<repo_name>
통합 범위 및 미래 개발
Prodigy-HF는 Hugging Face Hub에서 이용 가능한 방대한 모델과 언어를 활용하여 도메인별 및 실험적 사용 사례를 지원하도록 설계되었습니다. 개발자들은 라이브러리에 대한 추가 기능이 현재 개발 중이라고 밝혔습니다.