Mistral AI Shieldstral 1.0 3B 發佈

Mistral AI 推出了 Shieldstral,這是一款擁有 3B 參數的開源權重多模態安全分類器,旨在作為一種政策適應型(policy-adaptive)模型。與使用固定傷害分類法的傳統護欄模型不同,Shieldstral 允許使用者在推論時將安全政策定義為自然語言問題,使其在文本安全方面的表現能與規模大其七倍的模型相媲美,並在多模態審核方面建立了新的技術基準(state of the art)。

透過二元問答進行政策適應型審核

Shieldstral 將內容審核視為一項二元問答任務。這種方法消除了在不同應用程式或受眾之間更改安全定義時重新訓練的需求。模型對每個請求的組成包含三個部分:

  • <Instruct>: 定義評估上下文、嚴格程度以及對何謂不安全內容的可選定義。
  • <Query>: 一個單一的「是/否」問題(例如:「此內容是否促進肢體暴力?」)。
  • <Document>: 被評估的內容,可以是一個提示詞(prompt)、一個回應、一對提示詞-回應對,或是一張帶有可選文字的圖片。

透過僅讀取 yesno 的 logits 並進行 softmax-normalizing,模型會產生一個校準後的連續安全分數。這個單一介面將提示詞分類、回應審核、拒絕檢測以及毒性檢測統一成一個問題。

關鍵技術能力

Shieldstral 旨在實現跨多種模態的高效率與靈活性:

  • 多模態支援: 單一自然語言介面即可處理文本、圖片以及結合文本與圖片的內容。
  • 硬體效率: 3B 模型能夠在單張 16GB GPU 上運行。
  • 連續分數: 模型不提供離散標籤,而是透過單次前向傳播提供機率值,允許開發者根據置信度設定閾值或對結果進行排序。
  • 開源權重: 該模型根據 Apache 2.0 授權條款發佈。

訓練方法論

Mistral AI 透過專注於數據品質與多樣性來開發 Shieldstral,以克服 3B 參數模型的規模限制:

統一異質數據

為了處理來自公共安全數據集的衝突分類法與標籤,Mistral AI 使用了針對每個數據集的處理器,將所有數據轉換為一致的 instruction-query-document 格式。團隊變換了指令(instructions)與查詢(queries)的措辭,以防止過擬合,並根據來源(例如:針對對抗性越獄進行嚴格處理,針對回應品質數據進行寬鬆處理)校準了嚴格程度。

政策辨別力

為了防止模型僅僅是死記硬背固定標籤,團隊使用了一個 LLM 來建立安全文本的對比對(contrastive pairs)。這些對比對經過精心設計,使得重寫後的內容會違反某個特定政策,但不會違反類似的「兄弟」政策,從而訓練模型區分不同安全政策之間的精確邊界。

多模態接地(Multimodal Grounding)

由於視覺安全數據的稀缺性,Mistral AI 使用通用圖片數據集作為高品質的負樣本來補充審核數據集。他們還使用了視覺語言重排序器(vision-language reranker)來過濾圖片-查詢對,以減少幻覺與標籤錯誤的數據。

模型合併

Shieldstral 是透過 LoRA 進行微調並透過 SLERP 合併檢查點(checkpoints)而創建的。最終模型結合了在公共數據上校準的檢查點、一個專注於細粒度政策辨別力的檢查點,以及基礎指令模型(base instruct model)以維持指令遵循能力。

開發基礎設施

Shieldstral 是使用 Forge 開發的,Forge 是 Mistral AI 用於訓練、對齊與評估自定義模型的平台。Forge 處理了基礎設施、數據與模型分片(sharding),以及日誌記錄,讓研究團隊能夠專注於於數據策劃。

未來方向

Mistral AI 打算繼續改進 Shieldstral 的能力,包括多語言覆蓋範圍、針對長文本的魯棒性,以及更廣泛的多模態安全領域。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch