OpenAI 內容審查端點發布
OpenAI 推出了一個全新的審核端點,為開發者提供免費使用基於 GPT 的分類器,以偵測不當內容。此工具讓開發者能透過自動化偵測違反安全政策的內容,保護其應用程式免於被濫用。
自動內容分類功能
審核端點會分析文字輸入,以判斷內容是否屬於 OpenAI 內容政策所禁止的類別。具體而言,工具會評估文字是否屬於以下類別:
- 性相關
- 仇恨
- 暴力
- 鼓勵自我傷害
此端點在速度與準確度上進行了優化,以確保在各種應用中具備穩健的效能,降低大規模部署時 AI 生成內容產生不當輸出的風險。此功能使 AI 能在教育等敏感環境中使用,因為此類環境需要對內容安全有高度信心。
開發者整合與可及性
OpenAI 將審核端點作為免費服務提供,用於審核所有由 OpenAI API 產生的內容。透過提供此基礎設施,OpenAI 免除開發者自行建置與維護自訂分類器的需求,該公司將此描述為一項繁複的工作。
關鍵整合細節包括:
- 存取方式:可透過單一 API 呼叫使用。
- 範圍:目前支援 OpenAI API 產生的內容;不支援對第三方流量的監控。
- 使用案例:OpenAI API 客戶 Inworld 使用此端點,確保其基於 AI 的虛擬角色對目標受眾保持適當。
研究貢獻與透明度
為支援更廣泛的 AI 安全生態系統,OpenAI 同時發布了以下資源:
- 技術論文:說明開發審核端點所使用方法論的文件。
- 評估資料集:包含已依審核類別標記的 Common Crawl 資料的資料集,以鼓勵在內容分類方面的進一步研究。