OpenAI Model Spec 更新

OpenAI 已發布 Model Spec 的重大更新,該文件為管理文件,定義其 AI 模型的預期行為。此更新著重於可自訂性、透明度與知識自由,使用戶和開發者能在不受任意限制的情況下探索與創造,同時維持必要的安全防護措施以防止現實世界的傷害。

核心目標與指令鏈

Model Spec 透過結構化的「指令鏈」平衡實用性、安全性與符合使用者需求的競爭目標。此框架確保模型按照特定順序優先處理指令——平台(OpenAI)、開發者、使用者——從而在平台層級的界限內允許高度的客製化。

The Spec is organized around several key principles:

  • 指令鏈: 優先處理來自平台的指令,其次是開發者,最後是使用者,確保平台層級的規則得以維持,同時允許使用者/開發者對多數指南進行覆寫。
  • 共同追求真相: 注重客觀性並避免議程。模型被設計為高誠信助理,能澄清假設並提供關鍵回饋,而不會引導使用者。
  • 做到最好: 建立事實準確性、創意與程式實用性的基準標準。
  • 保持在界內: 定義拒絕的全面界限,詳細說明模型應該拒絕請求的具體原因,以避免協助造成傷害或濫用。
  • 親和易近: 設置預設的對話風格為溫暖、富有同理心且樂於助儘管可依使用者需求調整。
  • 使用適當的樣式: 提供格式與交付的指引(例如:項目符號、簡潔程式碼),以確保清晰與可用性。

對知識自由的承諾

更新後的 Model Spec 明確保護知識自由,確保 AI 可用於探索與辯論具爭議性或具挑戰性的主題,而不受任意限制。

此哲學融入了「保持在界內」與「共同追求真相」兩項原則。儘管模型將繼續拒絕造成重大傷害的請求——例如提供製造炸彈的說明或侵犯個人隱私——但鼓勵對文化或政治敏感問題提供深思熟慮的回答,而不推廣特定議程。

衡量遵從與進展

OpenAI 已實施一個測試框架,以利用由 AI 與專家人工審查結合生成的挑戰提示集來衡量模型遵循 Model Spec 原則的程度。

初步結果顯示,與 2024 年 5 月使用的系統相比,模型遵循度有顯著提升。OpenAI 認為此進展主要歸因於增強的對齊,儘管部分歸因於政策更新。為繼續此迭代過程,OpenAI 正與約 1,000 名個體進行試點研究,以審查模型行為與提出的規則。

開放原始碼與公共領域發布

為鼓勵合作與產業廣泛採用,OpenAI 已以 Creative Commons CC0 許可證將 Model Spec 的當前版本釋放至公共領域。

開發者與研究者可自由適應並在此基礎上進行建構。此外,OpenAI 已開放原始碼用於衡量遵從度的評估提示,並計畫未來釋放更多程式碼、工件與工具,用於 Spec 評估與對齊。這些資源可於專門的 GitHub 儲存庫中取得。

未來迭代

OpenAI 將基於研究、真實世界部署與社群回饋,繼續對 Model Spec 進行迭代。未來更新將直接在 model-spec.openai.com 追蹤,而非透過個別部落格文章。

Sources