使用 GPT-4 進行內容審核

OpenAI 正利用 GPT-4 自動化並優化內容審核,將開發和自訂內容政策所需的時間從數月縮短至數小時。此方法將人工審核員的角色從手動內容過濾轉向高層次的政策優化以及處理複雜的邊緣案例。

使用 GPT-4 加速政策開發

GPT-4 透過自動化政策指引的標註與測試,使內容審核分類器的快速創建與部署成為可能。與其依賴緩慢的手動內容篩選,政策專家現在使用與 LLM 的迭代迴圈來優化規則:

  1. 黃金樣本建立:政策專家辨識少量範例,並根據書面政策為其標註。
  2. 模型標註:GPT-4 讀取政策並為相同的資料集分配標籤,而不會看到人類的答案。
  3. 差異分析:專家檢查 GPT-4 的判斷與人類標註之間的差異。透過請 GPT-4 提供其標註背後的推理,專家能夠辨識政策定義中的模糊之處,並提供進一步的澄清。

此循環會重複進行,直到政策品質令人滿意為止。此時,經優化的政策會被轉換為分類器,以進行大規模部署。

透過模型蒸餾擴充審核

為了高效管理龐大的資料量,OpenAI 利用 GPT-4 的預測來微調更小、更高效的模型。這使系統在進行即時內容審核所需的規模與速度下,仍能保持 GPT-4 的複雜推理能力。

未來增強與風險偵測

OpenAI 正在探索多種技術方法,以提升審核預測的品質並發現新風險:

  • 推理改進:結合鏈式思考推理與自我批評,以提升預測準確度。
  • 主動風險識別:利用模型根據高層次的危害描述(受 Constitutional AI 啟發)來識別潛在有害內容。這些發現接著用於更新現有政策或為全新風險領域創建政策。

人類在迴圈中與偏見緩解

人類監督在審核過程中仍然至關重要,以減輕與 AI 訓練偏見相關的風險。由於語言模型的判斷可能容易受到不 desired 偏見的影響,OpenAI 維持一種人類在迴圈中的系統來監控、驗證並優化輸出。此策略使人力資源能從重複的過濾任務中解放出來,轉向持續政策改進所需的複雜邊緣案例。

Sources