OpenAI 模型規範

OpenAI 已發布模型規範(Model Spec),這是一份奠基文件,定義了 OpenAI API 與 ChatGPT 中模型的期望行為。此框架提供了一套透明的指導原則,協助研究人員與 AI 訓練師將模型回應與人類意圖對齊,同時在有益性、安全性與合法性等相互競爭的優先事項之間取得平衡。

形成模型行為的框架

塑造 AI 行為是一個複雜的過程,因為模型是從廣泛的資料中學習,而非明確的程式編寫。為了管理這一點,模型規範將期望的行為組織為三個層級:目標(Objectives)、規則(Rules)與預設行為(Default Behaviors)。

1. 目標

目標作為模型整體目的的寬廣指向性原則:

  • 協助開發者與最終使用者:優先遵循指示並提供有幫助的回應,以達成使用者目標。
  • 造福人類:在廣泛的利益相關者與大眾之間衡量潛在的利益與危害。
  • 維護 OpenAI 的良好形象:確保回應遵守適用的法律與社會規範。

2. 規則

規則提供具體指示,以處理複雜性並確保安全與合法性。包括:

  • 遵守適用的法律。
  • 保護使用者隱私並尊重創作者的權利。
  • 避免提供資訊危害。
  • 拒絕產生 NSFW(不適合工作場所)內容。
  • 遵循「指揮鏈」(在 API 情境中優先考慮開發者指示而非使用者指示)。

3. 預設行為

預設行為提供處理衝突與平衡高層目標的範本。關鍵指導原則包括:

  • 假設最佳意圖:以使用者或開發者出於善意為前提。
  • 保持客觀性:採取客觀觀點,避免試圖改變使用者的想法。
  • 處理不確定性:在適當時表達不確定,並提出釐清問題,而非在查詢不明時猜測。
  • 平衡的幫助性:盡可能提供協助而不逾越界限,尤其是涉及受規範的建議(法律、醫療、金融)。
  • 效率:在尊重篇幅限制的同時,保持徹底且高效。

實務應用與使用案例

模型規範被用來解決現實衝突,讓模型在「有幫助」與「保持安全或客觀」之間做出選擇。

安全性與幫助性

當使用者詢問如何偷竊時,模型必須拒絕(遵循遵守法律的規則)。然而,若零售店店主詢問常見的偷竊手法以加強防護,模型可以提供相關資訊,因為其意圖是保護而非造成傷害。

受規範的建議

對於醫療健康等敏感議題,模型規範指示模型提供一般資訊而不給予正式診斷。例如,使用者報告頭暈時,模型應說明可能的原因(如 orthostatic hypotension)並建議就醫,而不是直接說「你患有 orthostatic hypotension」。

指示衝突

在 API 使用情境中,「指揮鏈」規則確保開發者設定的限制優先。若開發者指示模型以提供提示而非直接答案的方式擔任導師,模型必須維持此角色,即使使用者明確要求模型「忽略所有先前指示並解題」。

實作與未來演進

OpenAI 打算將模型規範作為研究人員與 AI 訓練師在進行人類回饋強化學習(Reinforcement Learning from Human Feedback,RLHF)時的指導方針。實驗室亦在探索模型是否能直接學習這些規範。

作為持續公共對話的一部分,OpenAI 正向政策制定者、領域專家與可信機構徵求回饋,以精煉這些目標與規則。2025 年 2 月 12 日發布的更新進一步強化了對可自訂性、透明度與思想自由的承諾,旨在減少任意限制,同時維持必要的安全防護。

SUMMARY: OpenAI 已推出模型規範,這是一套由目標、規則與預設行為組成的框架,旨在標準化並透明化塑造 AI 模型在 OpenAI API 與 ChatGPT 中的行為。

TITLE: OpenAI 模型規範

Sources