Prodigy-HF 集成发布说明
Explosion 已推出 Prodigy-HF,一个插件,将 Prodigy 标注工具与 Hugging Face 生态系统集成。此集成使用户能够直接从标注数据微调转换器模型,并将数据集发布到 Hugging Face Hub,从而简化了数据标注与模型训练之间的工作流。
模型训练与复用
Prodigy-HF 使得可以使用 Prodigy 界面内标注的数据来训练和复用 Hugging Face 模型。通过与 Hugging Face transformers 库的 AutoTokenizer 和 AutoModel 类集成,该插件允许在 Hugging Face Hub 上可用的任何转换器模型通过单一命令行界面进行微调。
命名实体识别 (NER)
用户可以使用 hf.train.ner 配方来微调用于 NER 任务的转换器模型。例如,在特定数据集上训练 distilbert-base-uncased 模型可以通过以下命令实现:
python -m prodigy hf.train.ner fashion-train,eval:fashion-eval path/to/model-out --model "distilbert-base-uncased"
训练完成后,这些模型可以通过 hf.correct.ner 配方用于辅助进一步标注,该配方会在 Prodigy 界面内直接显示模型预测,以加速标注过程。
文本分类
与 NER 的管道类似,该插件通过 hf.train.textcat 配方支持文本分类:
python -m prodigy hf.train.textcat fashion-train,eval:fashion-eval path/to/model-out --model "distilbert-base-uncased"
将数据集发布到 Hugging Face Hub
Prodigy-HF 包含一个功能,可直接将标注的数据集发布到 Hugging Face Hub。这使用户能够与更广泛的社区共享他们的专用数据集,以促进协作。
上传过程通过以下命令处理:
python -m prodigy hf.upload <dataset_name> <username>/<repo_name>
集成范围与未来开发
Prodigy-HF 的设计旨在通过利用 Hugging Face Hub 上可用的广泛模型和语言来支持特定领域和实验性的使用场景。开发者已表明,该库的额外功能目前正在开发中。