OpenAI AI 文本分類器發布(2023 年 1 月)

TL;DR

OpenAI 於 2023 年 1 月 31 日推出了一個免費、公開可用的 AI 文本分類器,以協助偵測 AI 撰寫的英文內容,但此工具有限制:它僅能正確標記 26% 的 AI 生成文本,且在人類文本上產生 9% 的偽陽性率,之後因準確度低而被撤下。


分類器的功能

此分類器是一個微調的語言模型,用於區分人類撰寫與 AI 撰寫的段落。它在配對資料集上進行訓練,該資料集包含相同提示由人類與多種來自 OpenAI 及其他供應商的語言模型所回答的內容。對於網頁示範,OpenAI 設定了較高的信心水準以降低偽陽性,僅在模型非常確定時才將文本標記為「可能為 AI 撰寫」。

報告的效能

  • True positive rate: 在英語 AI 生成文本的挑戰集上為 26%。
  • False positive rate: 9% 的人類撰寫文本被錯誤標記為 AI 撰寫。
  • Length dependence: 隨著輸入長度增加,準確度提升;分類器在少於 1,000 字元的文本上尤其不可靠。
  • Comparison to prior work: 新模型的可靠性顯著高於 OpenAI 先前隨 GPT‑2 輸出資料集發布的偵測器。

主要限制

  • Not a decision‑making tool: 此分類器僅應作為輔助訊號使用,而非最終判決。
  • Short text weakness: 少於 1,000 字元的輸入會產生極不可靠的預測。
  • Language and domain scope: 僅針對英語校準,對其他語言及程式碼的表現不佳。
  • Predictable content: 決定性的文本(例如質數列表)無法被區分。
  • Adversarial editing: 人為編輯可逃避偵測,持續的攻擊可能超過重新訓練的速度。
  • Calibration issues: 超出訓練分佈時,模型可能對錯誤預測過度自信。

訓練資料與方法論

OpenAI 組建了一套人類撰寫的摘錄資料集,來源於預訓練語料庫以及提交給 InstructGPT 的人類示範。每段摘錄被分為提示與回應。對於每個提示,回應由多個語言模型產生,包含 OpenAI 自家的模型以及其他組織的模型。分類器隨後在這些人類‑AI 配對上進行微調。

預期使用情境與外展

OpenAI 強調了幾項潛在的應用:

  • 偽裝成人類對話的自動化錯資訊活動。
  • 辨識使用 AI 工具撰寫論文的學術不端行為。
  • 防止 AI 聊天機器人被誤稱為人類對話者。

該實驗室亦發布了針對教育工作者使用 ChatGPT 的初步資源,並透過公開表單邀請教師、管理者、學生與家長提供回饋。OpenAI 強調,分類器是開發文本、音訊與視覺內容來源技術更廣泛努力的一部分。

目前狀態

截至 2023 年 7 月 20 日,AI 文本分類器因準確度低而下線。OpenAI 表示正研究更有效的來源方法,並持續致力於部署能協助使用者判斷內容是否由 AI 生成的工具。


Authors: Jan Hendrik Kirchner, Lama Ahmad, Scott Aaronson, Jan Leike

Sources