OpenAI、Cohere 與 AI21 Labs 部署語言模型的最佳實踐

OpenAI、Cohere 與 AI21 Labs 為開發或部署大型語言模型(LLM)的組織制定了一套初步的最佳實踐。這些指導方針旨在減輕強大 AI 技術所帶來的風險,確保其增強人類能力,同時將傷害降至最低。

禁止濫用語言模型

LLM 供應商應實施嚴格的使用指南與技術基礎設施,以防止該技術被用於惡意目的。

  • 使用指南與使用條款: 供應商必須公布明確的條款,禁止對社會、個人與社群造成實質傷害。這包括禁止將 LLM 用於垃圾郵件、詐騙或假造草根運動。此外,指南應識別需要額外審查或完全禁止的高風險使用情境,例如基於受保護特徵對人進行分類。
  • 執行基礎設施: 為確保遵守使用指南,供應商應建立系統,如速率限制、內容過濾、針對生產環境存取的應用審批流程,以及異常活動監控。

緩解非故意傷害

由於沒有任何預防措施能完全消除非預期傷害的可能性,供應商必須主動處理模型行為,並對仍存的弱點保持透明。

  • 主動緩解: 供應商應採用全面的模型評估以評估限制,並使用如從人類回饋學習等技術來減少不安全行為。亦應努力減少訓練語料庫中可能的偏見來源。
  • 弱點文件化: 供應商必須記錄已知的弱點,包括模型產生不安全程式碼的能力或固有偏見。此文件應包含針對模型及其預期使用情境的安全最佳實踐。

利益相關者合作與倫理勞動

負責任的部署需要多元觀點與全產業的透明度,以解決模型在現實世界中的運作方式。

  • 多元團隊: 組織應建立背景多元的團隊,以確保模型不會加劇偏見或對特定族群失效。
  • 公開揭露: 應公開分享有關 LLM 安全與濫用的經驗教訓,以促進跨產業的迭代與安全標準的廣泛採用。
  • 勞動標準: 供應商必須尊重 LLM 供應鏈中的所有勞動者。這包括為內部審查模型輸出的員工維持高標準的工作條件,並確保第三方供應商遵守明確規範,例如允許標註者退出特定任務。

產業支持與觀點

此聯合建議已獲得多個 AI 組織與研究中心的支持,強調產業合作的重要性。

「雖然 LLM 充滿了許多潛力,但它們具有顯著的固有安全問題,需要加以解決。這些最佳實踐是減少這些模型傷害、最大化其潛在利益的重要一步。」

—Anthropic

「隨著大型語言模型(LLM)變得越來越強大且具表現力,風險緩解變得愈發重要。我們歡迎這些以及其他主動減少傷害、向使用者指出需特別謹慎領域的努力。」

—John Bansemer, Director of the CyberAI Project and Senior Fellow, Center for Security and Emerging Technology(CSET)

「Google 確認在分析模型與訓練資料以減輕傷害、偏見與錯誤呈現風險方面,全面策略的重要性。」

—Google

「為了實現大型語言模型的承諾,我們必須持續以產業身份合作,並分享負責任開發與部署它們的最佳實踐,同時減輕潛在風險。」

—Microsoft

「基礎模型(如大型語言模型)的安全性正成為日益關注的社會議題。我們讚揚 Cohere、OpenAI 與 AI21 Labs 採取首步,概述負責任開發與部署的高層原則…」

—Percy Liang, Director of the Stanford Center for Research on Foundation Models(CRFM)

Sources