GLiGuard: 高効率な小型言語モデルでAI安全性をスケールする

AIエージェントが単純なチャットボットから、ウェブ閲覧やコード実行が可能な自律的な存在へと移行するにつれ、LLMの導入に伴うリスクプロファイルは変化しました。重要性は単なる攻撃的テキストに留まらず、現実世界での被害防止にあります。これらのリスクを軽減するために、開発者はガードレール――ユーザーとモデルの間に位置し、悪意のあるプロンプトや有害な応答をフィルタリングする安全層――に依存しています。

従来、最先端(SOTA)のガードレールモデルは大規模なデコーダーオンリートランスフォーマーアーキテクチャ上に構築されてきました。柔軟性はあるものの、これらのモデルは安全性モデレーションをテキスト生成タスクとして扱うため、顕著なレイテンシとコストが発生します。Pioneer AIは、GLiGuardという300百万パラメータのモデルをリリースし、効果的な安全性モデレーションに数十億パラメータは不要であることを実証しました。

デコーダーベースのガードレールのボトルネック

現在のガードレールモデルの多く(LlamaGuardやShieldGemmaなど)は自己回帰的に動作します。標準的なLLMがチャット応答を生成する方式と同様に、安全性判定をトークン単位で生成します。このアプローチには主に3つの欠点があります:

  1. Sequential Latency(シーケンシャルレイテンシ): 生成がシーケンシャルであるため、分類に比べて本質的に遅くなります。
  2. Computational Cost(計算コスト): 7Bから27Bパラメータのモデルは大量のGPUリソースを必要とし、プロダクションでのスケールが高コストになります。
  3. Compounding Delay(遅延の累積): 安全性モデレーションはしばしば複数の次元をチェックする必要があります(例:ジャイルブレイクか?PIIが含まれるか?ヘイトスピーチか?)。デコーダーモデルでは、これらの評価が通常順番に行われ、追加の安全基準ごとにレイテンシが累積します。

新たなアプローチ:モデレーションを分類タスクとして再定義する

GLiGuardは、デコーダーオンリーの流れから脱却し、小規模なエンコーダーベースのアーキテクチャを採用しています。安全性ステータスを記述するテキスト応答を生成する代わりに、GLiGuardはモデレーションをテキスト分類問題として再定義します。

入力テキストとタスク定義(ラベル)を同時にエンコードすることで、モデルは単一のフォワードパスで全ての安全ラベルを同時にスコア付けできます。つまり、5つの異なる安全次元を評価するのに要する時間は、1つを評価するのと同じです。

4つの同時モデレーションタスク

GLiGuardは、単一のパスで4つの重要な安全次元を評価します:

  • Safety Classification(安全性分類): 入力プロンプトと出力応答の両方に適用される二値チェック(安全/不安全)。
  • Jailbreak Strategy Detection(ジャイルブレイク戦略検出): プロンプトインジェクション、ロールプレイバイパス、ソーシャルエンジニアリングなど、11の特定戦略を識別。検出された戦略は自動的にプロンプトを不安全としてフラグ付けします。
  • Harm Category Detection(有害カテゴリ検出): 暴力、性的コンテンツ、PII漏洩、著作権侵害など、14カテゴリに分類。単一入力で複数カテゴリがトリガーされることがあります。
  • Refusal Detection(拒否検出): モデルがリクエストに従ったか、拒否したかを判定。これは「過剰拒否」(安全なプロンプトを拒否する)や「偽の遵守」の測定に重要です。

パフォーマンス:精度と効率の比較

GLiGuardを検証するため、Pioneer AIはLlamaGuard4(12B)、ShieldGemma(27B)、NemoGuard(8B)など、6つの主要なデコーダーベースガードモデルと比較テストを実施しました。

精度ベンチマーク

競合他社より23倍から90倍小さいにもかかわらず、GLiGuardの精度は現在のSOTAに匹敵します:

  • Prompt Classification(プロンプト分類): 平均F1スコア87.7を達成し、最良モデル(PolyGuard-Qwen)に対してわずか1.7ポイント差です。
  • Response Classification(応答分類): 平均F1スコア82.7を達成し、Qwen3Guard-8Bに次ぐ2位です。
  • Competitive Edge(競争優位性): LlamaGuard4-12BおよびShieldGemma-27Bを上回り、安全性に必要な分類能力がはるかにコンパクトなアーキテクチャで実現できることを示しました。

速度とスループット

エンコーダーベースモデルへのアーキテクチャ変更により、単一のNVIDIA A100 GPU上で劇的な効率向上が得られます:

  • Throughput(スループット): 最大16.2倍のスループット向上(バッチサイズ4で133サンプル/秒 vs. 8.2サンプル/秒)。
  • Latency(レイテンシ): 最大16.6倍のレイテンシ低減(シーケンス長64で26ms vs. 426ms)。

訓練とデプロイ

GLiGuardは、Human-annotatedデータ(WildGuardTrainデータセット経由)とGPT-4が生成した合成データの混合で訓練されました。毒性のある発言と暴力の違いなど、細かな区別に関する初期の訓練課題を解決するため、チームはPioneerを用いて補足的な合成エッジケースを生成しました。

このモデルは、AdamWオプティマイザを使用し、GLiNER2-base-v1チェックポイントを20エポック微調整して開発されました。

結論

エージェント型AIを構築する開発者にとって、ガードレールはオプションではなく、重要なインフラです。しかし、大規模デコーダーモデルのレイテンシペナルティはユーザー体験に摩擦を生むことが多いです。GLiGuardは、生成から分類へシフトすることで、計算オーバーヘッドのごく一部でSOTAレベルの安全性モデレーションを実現できることを示しています。

Apache 2.0ライセンスの下、Hugging Face Hubで入手可能なGLiGuardは、膨大なインフラ投資を必要とせずに、高性能な安全層をデプロイする実用的なオープンソースの道筋をチームに提供します。

Sources