Mistral AI Shieldstral 1.0 3B Release

Mistral AIは、ポリシー適応型のマルチモーダル安全性分類器として設計された3Bパラメータのオープンウェイトモデル、Shieldstralを導入しました。危害に関する固定された分類体系を使用する従来のガードレールモデルとは異なり、Shieldstralは推論時にプレーンランゲージの質問として安全性ポリシーを定義できるため、テキストの安全性において最大7倍のサイズのモデルに匹敵する性能を発揮し、マルチモーダルなモデレーションにおいて新たなSOTA(State of the Art)を確立します。

Policy-Adaptive Moderation via Binary Question-Answering

Shieldstralは、コンテンツモデレーションを二値の質問応答タスクとして扱います。このアプローチにより、異なるアプリケーションや対象読者に応じて安全性の定義が変更される場合でも、再学習の必要がなくなります。モデルへの各リクエストは、以下の3つのコンポーネントで構成されます:

  • <Instruct>: 評価コンテキスト、厳格さのレベル、および何が安全でないコンテンツを構成するかというオプションの定義を定義します。
  • <Query>: 単一のyes/noの質問(例:「このコンテンツは物理的な暴力を助長しますか?」)。
  • <Document>: 評価対象となるコンテンツ。プロンプト、レスポンス、プロンプトとレスポンスのペア、またはテキスト付きの画像がこれに当たります。

yesnoのロジットのみを読み取り、それらをソフトマックス正規化することで、モデルは較正された連続的な安全性スコアを生成します。この単一のインターフェースにより、プロンプトの分類、レスポンスのモデレーション、拒否の検出、および毒性の検出が1つの問題に統合されます。

Key Technical Capabilities

Shieldstralは、複数のモダリティにわたって効率性と柔軟性を備えるように設計されています:

  • Multimodal Support: 単一の自然言語インターフェースで、テキスト、画像、およびテキストと画像の組み合わせたコンテンツを扱えます。
  • Hardware Efficiency: 3Bモデルは、単一の16GB GPUで実行可能です。
  • Continuous Scoring: 離散的なラベルではなく、モデルは単一のフォワードパスから確率を提供するため、開発者は信頼度に基づいて結果を閾値処理またはランク付けすることができます。
  • Open Weights: モデルはApache 2.0ライセンスの下でリリースされます。

Training Methodology

Mistral AIは、3Bパラメータモデルのサイズ制限を克服するために、データの品質と多様性に焦点を当ててShieldstralを開発しました:

Unifying Heterogeneous Data

公開されている安全性データセットの相反する分類体系やラベルを扱うため、Mistral AIはデータセットごとのプロセッサを使用して、すべてのデータを一貫したinstruction-query-document形式に変換しました。チームは、過学習を防ぐために指示(instructions)とクエリ(queries)の言い回しを変化させ、ソースに基づいて厳格さを較正しました(例:敵対的なjailbreakに対しては厳格に、レスポンスの品質データに対しては寛容に)。

Policy Discrimination

モデルが単に固定されたラベルをメモライゼーション(記憶)するのを防ぐため、チームはLLMを使用して、安全なテキストの対照的なペアを作成しました。これらのペアは、書き換えを行うと特定のポリシーに違反するが、類似した「兄弟」ポリシーには違反しないように設計されており、モデルが異なる安全性ポリシー間の正確な境界を distinguish 分別できるように訓練されました。

Multimodal Grounding

視覚的な安全性データが不足しているため、Mistral AIはモデレーションデータセットを、高品質なネガティブサンプルとして汎用的な画像データセットで補完しました。また、画像とクエリのペアをフィルタリングして、ハルシネーション(幻覚)や誤ラベル付けされたデータを減らすために、vision-language rerankerを使用しました。

Model Merging

Shieldstralは、LoRAによるファインチューニングとSLERPによるチェックポイントの統合(merging)によって作成されました。最終的なモデルは、公開データで較正されたチェックポイント、きめ細かなポリシー判別を目的としたチェックポイント、および指示に従う能力を維持するためのベースのinstructモデルを組み合わせたものです。

Development Infrastructure

Shieldstralは、Mistral AIのカスタムモデルのトレーニング、アライメント、および評価のためのプラットフォームであるForgeを使用構築されました。Forgeは、インフラストラクチャ、データの分割(sharding)、モデルの分割(sharding)、およびロギングを処理することで、研究チームがデータキュレーションに集中できるようにしました。

Future Directions

Mistral AIは、Shieldstralの能力を、多言語対応、長いドキュメントに対する堅牢性、およびより広範なマルチモーダルな安全性において、継続的に向上させることを意図しています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch