Goochbeater/Spiritual-Spell-Red-Teaming
A repo for jailbreaking various LLMs, mainly Claude
解決的問題
本專案解決了對 AI 模型進行安全測試(紅隊測試)的需求,特別著重於識別可能讓使用者繞過安全過濾器並產生受限內容的漏洞。
運作方式
本專案提供一套用於測試 AI 模型韌性的技術與提示。重點在於「精神」或創造性的紅隊測試,透過複雜的提示工程,發現模型如何被操縱以忽略其安全指南。
適用對象
適用於希望透過模擬對抗性攻擊來評估模型安全性與對齊性的安全研究人員與 AI 開發者。
主要亮點
- 專注於 AI 模型的紅隊測試與安全研究。
- 提供測試安全過濾器繞過的方法。
- 目標是透過對抗性測試提升模型的韌性。
相關
- 專案
- 專案
- 專案
- Dispatch
- Dispatch