Hugging Face エキスパートアクセラレーションプログラム: Witty Works ケーススタディ
Witty Works は Hugging Face エキスパートアクセラレーションプログラムと協力し、ルールベースの言語解析ツールから文脈依存型のインクルーシブ言語向け機械学習分類器へと移行しました。この転換により、執筆支援ツールは語彙リストだけに頼るのではなく、周囲の文脈に基づいて非インクルーシブな単語を正確に識別できるようになりました。
言語解析から文脈分類への移行
Witty Works は当初、事前学習済み spaCy モデルを用いた転移学習で執筆支援ツールを開発しました。この基本的な手法は、レマタイゼーション、言語解析、品詞タグ、性別、単語の依存関係といった特徴量の抽出を利用し、英語とドイツ語で約 2,300 語とイディオムからなるナレッジベースに対して非インクルーシブな単語をハイライトしました。
この手法は語彙の 85% には有効でしたが、文脈依存の単語には対応できませんでした。例えば、"Fossil fuels are not renewable resources" の中の "fossil" はインクルーシブですが、"He is an old fossil" の中の "fossil" は非インクルーシブです。これを解決するため、Witty Works は語の意味的文脈を理解できる Hugging Face のトランスフォーマーへと移行しました。
SetFit を用いた Few-Shot 学習の実装
Witty Works は大きなデータボトルネックに直面しました。標準的な BERT モデルをファインチューニングするにはカテゴリごとに数百件のアノテーション済みサンプルが必要で、コストと時間がかかりすぎました。これを解決するため、Hugging Face のエキスパートは以下の技術的転換を推奨しました。
単語埋め込みから文埋め込みへ
特定の単語のトークン埋め込みを抽出する代わりに、チームは Sentence Transformers アーキテクチャを用いた文脈化された文埋め込みに切り替えました。この手法は Siamese とトリプレットネットワーク構造を利用し、意味的に類似した文がベクトル空間で近くなるようにし、得られた埋め込みを K 最近傍 (KNN) やロジスティック回帰といった従来の分類器の入力として使用できます。
SetFit による Few-Shot ファインチューニング
Witty Works は SetFit(Sentence Transformer Fine-tuning)を採用しました。このフレームワークはコントラスト学習と文の意味的類似性を組み合わせたものです。これにより、チームは従来想定されていた 100〜200 件に対し、特定の単語につき 15〜20 件のラベル付き文だけで高精度を実現できました。
モデル選択とデプロイ
リアルタイムのブラウザ拡張機能で低レイテンシを確保するため、Witty Works と Hugging Face は複数の Sentence Transformer モデルをテストしました。その結果、mpnet-base-v2 とロジスティック回帰および KNN を組み合わせたものを選択しました。
主要なデプロイ結果は以下の通りです:
- インフラストラクチャ: モデルは Azure にデプロイされました。
- パフォーマンス: モデルは 0.92 の精度を達成しました。
- 効率: 訓練データの削減により、トレーニングセットのバイアスを積極的に管理するために必要な手動レビュー作業が最小化されました。
ML ワークフローに関するエキスパートの洞察
この協業は、ML ワークフローを構築するための具体的な反復手法を浮き彫りにしました。Hugging Face のチーフエバンジェリストである Julien Simon が述べたように:
"ワークフローを構築する Hugging の方法: オープンソースの事前学習済みモデルを見つけ、すぐに評価し、何がうまくいくか、何がうまくいかないかを確認する。反復することで、すぐに学びが始まります"
Witty Works にとって、このアプローチはデータアノテーションとデプロイの金銭的・時間的コストを削減し、スタートアップの開発プロセスにおける技術的なスパーリングパートナーを提供しました。