代碼合成大型語言模型的危害分析框架

OpenAI 已開發出一套危害分析框架,旨在揭露與部署能進行先進程式碼合成的大型語言模型(LLMs)相關的安全風險與危害,例如 Codex。此框架的必要性在於,雖然程式碼生成模型帶來顯著的益處,但它們同時也可能被濫用、產生對齊問題,且有可能加速技術領域的進展,進而產生不穩定的影響。

多維危害分析

  • 技術風險:評估模型固有的限制以及生成不安全或錯誤程式碼的潛在可能性。
  • 社會風險:分析這些模型的部署如何影響社會結構與互動。
  • 政治風險:評估模型可能被用於影響政治穩定或政治程序的方式。
  • 經濟風險:檢視自動化程式碼合成可能對經濟造成的擾動。

程式碼生成能力的評估框架

為了支援危害分析,OpenAI 採用一套新穎的評估框架,衡量先進程式碼生成技術的能力。此評估聚焦於兩個關鍵指標:

  1. 規格提示複雜度:框架判定模型如何處理用於指定所需程式碼的提示之複雜度與表達力。
  2. 相對於人類的能力:框架評估模型相較於人類在理解與執行這些規格方面的能力。

透過將模型的能力以這些基準量化,OpenAI 能更好地辨識出模型生成程式碼的能力何時可能從有用的工具轉變為潛在的危害。

Sources