衡量大型語言模型可擴展監督的進展
Anthropic 推出了一個衡量可擴展監督(scalable oversight)進展的框架,這是一項關於如何監督技能超越人類能力的 AI 系統的挑戰。這項研究至關重要,因為開發安全且有用的通用型 AI 需要一種方法,讓人類能夠監督那些在大多數任務相關技能上可能超越人類的系統。
The Challenge of Scalable Oversight
可擴展監督是指監督那些在特定任務相關的大多數技能上可能超越人類的 AI 系統的問題。在實證研究中,主要的困難在於目前的通用 AI 系統尚未在所有領域廣泛地超越人類能力。
Experimental Design for Scalable Oversight
為了使用現有的模型來研究可擴展監督,Anthropic 提出了一種實驗設計,其核心在於那些人類專家可以成功完成、但未經協助的人類與目前的通用 AI 系統都會失敗的任務。這種方法允許研究人員將人類專家作為正確性的基準(ground truth),同時測試模型是否能協助非專業人士達到該專家的表現水準。
Proof-of-Concept Results
Anthropic 使用了兩個問答任務進行了概念驗證實驗:MMLU (Massive Multitask Language Understanding) 和有時間限制的 QuALITY。該實驗測試了一種可擴展監督的基準策略,即人類參與者透過聊天與一個不可靠的大型語言模型 (LLM) 對話助手進行互動。
該實驗的主要發現包括:
- Improved Human Performance: 人類參與者在與 LLM 助手互動後,表現大幅優於其自身未經協助的表現。
- Improved System Performance: 人類與 AI 的協作表現優於模型單獨運作的表現。
- Viability of Study: 結果顯示,即使在模型不可靠的情況下,使用目前的模型來研究可擴展監督是可行的。
Implications for AI Safety
這些發現強化了最近的證據,即大型語言模型可以有效地協助人類處理困難任務。透過展示人類可以利用 LLM 來提升自己在複雜任務上的表現,研究人員建議,隨著 AI 系統能力的增強,人類可以透過這種方式維持對 AI 系統的監督。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch