Prodigy-HF 統合リリースノート

Prodigy-HF 統合リリースノート Explosionは、注釈付きデータ上でHugging Faceトランスフォーマーモデルの直接ファインチューニングを可能にし、Hugging Face Hubへのデータセットの直接アップロードを可能にするプラグインProdigy-HFをリリースしました。

Prodigy-HF 統合リリースノート

Explosionは、ProdigyアノテーションツールとHugging Faceエコシステムを統合するプラグインProdigy-HFを導入しました。この統合により、ユーザーは注釈付きデータから直接トランスフォーマーモデルをファインチューニングし、Hugging Face Hubにデータセットを公開できるようになり、データラベリングとモデルトレーニングの間のワークフローが合理化されます。

モデルのトレーニングと再利用

Prodigy-HFは、Prodigyインターフェース内で注釈されたデータを使用して、Hugging Faceモデルのトレーニングと再利用を可能にします。Hugging Face TransformersライブラリのAutoTokenizerおよびAutoModelクラスと統合することにより、このプラグインはHugging Face Hubで利用可能なあらゆるトランスフォーマーモデルを、単一のコマンドラインインターフェースを介してファインチューニングできるようにします。

名前付きエンティティ認識 (NER)

ユーザーは、hf.train.nerレシピを使用して、NERタスクのトランスフォーマーモデルをファインチューニングできます。たとえば、特定のデータセット上でdistilbert-base-uncasedモデルをトレーニングするには、次のコマンドを使用します:

python -m prodigy hf.train.ner fashion-train,eval:fashion-eval path/to/model-out --model "distilbert-base-uncased"

トレーニング後、これらのモデルは、hf.correct.nerレシピを使用してさらにアノテーションを支援するために使用できます。このレシピは、Prodigyインターフェース内でモデルの予測を直接表示し、ラベリングプロセスを加速します。

テキスト分類

NERのパイプラインと同様に、このプラグインはhf.train.textcatレシピを介してテキスト分類をサポートします:

python -m prodigy hf.train.textcat fashion-train,eval:fashion-eval path/to/model-out --model "distilbert-base-uncased"

Hugging Face Hubへのデータセット公開

Prodigy-HFには、注釈付きデータセットをHugging Face Hubに直接公開する機能が含まれています。これにより、ユーザーはカスタムデータセットをより広いコミュニティと共有し、コラボレーションを促進することができます。

アップロードプロセスは、次のコマンドで処理されます:

python -m prodigy hf.upload <dataset_name> <username>/<repo_name>

統合の範囲と今後の開発

Prodigy-HFは、Hugging Face Hubで利用可能な豊富なモデルと言語を活用し、ドメイン固有および実験的なユースケースをサポートするように設計されています。開発者は、ライブラリに追加の機能が現在開発中であることを示しています。

Sources