Prodigy-HF 統合リリースノート
Prodigy-HF 統合リリースノート Explosionは、注釈付きデータ上でHugging Faceトランスフォーマーモデルの直接ファインチューニングを可能にし、Hugging Face Hubへのデータセットの直接アップロードを可能にするプラグインProdigy-HFをリリースしました。
Prodigy-HF 統合リリースノート
Explosionは、ProdigyアノテーションツールとHugging Faceエコシステムを統合するプラグインProdigy-HFを導入しました。この統合により、ユーザーは注釈付きデータから直接トランスフォーマーモデルをファインチューニングし、Hugging Face Hubにデータセットを公開できるようになり、データラベリングとモデルトレーニングの間のワークフローが合理化されます。
モデルのトレーニングと再利用
Prodigy-HFは、Prodigyインターフェース内で注釈されたデータを使用して、Hugging Faceモデルのトレーニングと再利用を可能にします。Hugging Face TransformersライブラリのAutoTokenizerおよびAutoModelクラスと統合することにより、このプラグインはHugging Face Hubで利用可能なあらゆるトランスフォーマーモデルを、単一のコマンドラインインターフェースを介してファインチューニングできるようにします。
名前付きエンティティ認識 (NER)
ユーザーは、hf.train.nerレシピを使用して、NERタスクのトランスフォーマーモデルをファインチューニングできます。たとえば、特定のデータセット上でdistilbert-base-uncasedモデルをトレーニングするには、次のコマンドを使用します:
python -m prodigy hf.train.ner fashion-train,eval:fashion-eval path/to/model-out --model "distilbert-base-uncased"
トレーニング後、これらのモデルは、hf.correct.nerレシピを使用してさらにアノテーションを支援するために使用できます。このレシピは、Prodigyインターフェース内でモデルの予測を直接表示し、ラベリングプロセスを加速します。
テキスト分類
NERのパイプラインと同様に、このプラグインはhf.train.textcatレシピを介してテキスト分類をサポートします:
python -m prodigy hf.train.textcat fashion-train,eval:fashion-eval path/to/model-out --model "distilbert-base-uncased"
Hugging Face Hubへのデータセット公開
Prodigy-HFには、注釈付きデータセットをHugging Face Hubに直接公開する機能が含まれています。これにより、ユーザーはカスタムデータセットをより広いコミュニティと共有し、コラボレーションを促進することができます。
アップロードプロセスは、次のコマンドで処理されます:
python -m prodigy hf.upload <dataset_name> <username>/<repo_name>
統合の範囲と今後の開発
Prodigy-HFは、Hugging Face Hubで利用可能な豊富なモデルと言語を活用し、ドメイン固有および実験的なユースケースをサポートするように設計されています。開発者は、ライブラリに追加の機能が現在開発中であることを示しています。