Hugging Face 倫理與社會通訊 #3:倫理開放倡議
TL;DR
Hugging Face 介紹了一套倫理開放工具——六個高層次的倫理類別、社群舉報功能、「Not For All Audiences」標籤,以及擴充的文件——以實現更安全、更具包容性的開源機器學習開發。
使命:開放且良善的機器學習
Hugging Face 將其使命定位為民主化 良善 的機器學習(ML)。開放式開發去中心化權力,使眾多利益相關者能根據多元價值觀塑造 AI。組織承認,開放性可能降低直接的風險控制,尤其是隨著模型變得更強大且產生更廣泛的內容。因此,Hugging Face 強調需要強健的審查、偏見偵測與文件化,以減輕往往對少數族群產生不成比例影響的危害。
倫理類別——六個高層次標籤
為協助使用者尋找並貢獻倫理導向的機器學習工作,Hugging Face 基於社群提交的 Spaces 分析,定義了六個無行話的類別:
- Rigorous – 強調最佳實踐,如偏見與公平審計、隱私保護以及明確的限制說明。
- Consentful – 支持受技術影響之個體的自我決定(參見 Consentful Tech)。
- Socially Conscious – 突顯推動社會、環境或科學目標的專案。
- Sustainable – 專注於降低機器學習生態足跡的技術。
- Inclusive – 擴大參與建構與受惠於機器學習系統的對象。
- Inquisitive – 照亮不平等與權力結構,促使社群重新思考與技術的關係。
這些標籤會顯示於相關的倉庫,並會隨著社群回饋而演變。更多資訊請見 https://huggingface.co/ethics。
安全防護——風險緩解的工具與流程
Hugging Face 拒絕「全有或全無」的開放發布方式。相反地,它提供多種手段來控制機器學習產物的分享與再利用:
- Flagging Feature – 使用者可以舉報違反內容指導原則的模型、資料集、Spaces 或討論。舉報圖示會出現在每個倉庫頁面;說明欄位允許舉報者提供背景資訊。
- Community Monitoring – 版主監督討論板,以執行平台的行為守則。
- Enhanced Model Cards – 受歡迎的模型會獲得詳細文件,涵蓋社會影響、偏見、預期用途以及超出範圍的情境。
- Audience‑Guiding Tags –
not-for-all-audiences標籤會觸發警告彈窗,允許觀眾在確認內容後自行選擇觀看。 - Responsible AI Licenses (RAIL) – Hugging Face 推廣開放負責任 AI 授權(Open Responsible AI Licenses),適用於如 BLOOM 與 BigCode 等模型,使法律條款與倫理意圖相符。
- Misuse Research – 持續的分析(例如 arXiv:2302.04844)辨識出具有高度濫用潛力的模型與資料集。
舉報工作流程
- 點擊倉庫頁面上的舉報圖示。
- 提供對問題的詳細說明。
- 舉報會在倉庫的社群分頁開啟對話,促成舉報者、倉庫擁有者與 Hugging Face 工作人員之間的透明對話。
高風險舉報的回應選項
- 降低在趨勢資訊流中的可見度。
- 啟用門檻以限制存取(請參閱模型與資料集門檻文件)。
- 將倉庫設為私有。
- 完全停用存取。
新增「Not For All Audiences」標籤
- 編輯模型或資料集卡片。
- 在
tags欄位加入not-for-all-audiences。 - 提交 pull request;合併後,標籤會顯示於倉庫頁面。
- 使用者會看到帶有觀看內容選項的警告彈窗;可在「內容偏好」中調整設定。
社群行動呼籲
Hugging Face 邀請致力於安全防護的研究者在 Hub 上分享他們的工具。近期社群貢獻包括:
- LLM Watermarking – 大型語言模型的浮水印示範(John Kirchenbauer 等,arXiv:2301.10226)。
- Model Card Generation Tool – 用於簡化完整模型卡片製作的互動工具。
- Photoguard – 用於偵測影像操控的防護工具。
這些範例說明了開源貢獻如何直接提升安全性與透明度。
本通訊由 Irene Solaiman、Giada Pistilli、Nima Boscarino、Yacine Jernite、Elizabeth Allendorf 與 Margaret Mitchell 代表倫理與社會團隊撰寫。