OpenAI 迭代放大於複雜目標學習
OpenAI 已提出「迭代放大」這項 AI 安全技術,旨在規範超出人類規模的複雜行為與目標。此方法透過示範如何將複雜任務分解為較簡單、可管理的子任務,使 AI 系統得以在人類無法直接執行或判斷的任務上進行訓練。
複雜任務的訓練訊號挑戰
機器學習需要訓練訊號——例如監督式學習中的標籤或強化學習中的獎勵——來評估表現並促進學習。雖然某些任務擁有演算法式的訓練訊號(例如圍棋比賽的計分)或可由人類判斷,但許多現實世界的任務過於複雜,超出人類的執行或判斷能力。例子包括管理大型電腦網路的安全或設計複雜的交通系統。
若缺乏精確的訓練訊號,AI 系統將無法學習任務,甚至可能因獎勵函數錯誤而產生意外且危險的行為。
迭代放大運作方式
迭代放大根據兩項主要假設為複雜任務產生訓練訊號:第一,認為人類能辨識構成較大任務之較小組件;第二,認為人類能執行該任務的極小規模實例。
此過程遵循迭代循環:
- Initial Training: 系統抽樣小型子任務,並透過能解決這些小規模問題的人類示範進行訓練。
- Task Expansion: 系統抽樣稍大一些的任務。人類透過將其分解為 AI(在前一步已訓練好)已能解決的較小片段來協助解決。
- Direct Learning: 透過人類協助分解取得的較難任務解答,作為訓練訊號,訓練 AI 直接解決這些第二層任務,無需人工介入。
- Iteration: 重複此過程,逐步為日益複合的任務建立訓練訊號。
若成功,將產生一個完全自動化的系統,能在缺乏初始直接訓練訊號的情況下解決高度複合的任務。
玩具領域的實驗結果
由於在原型階段處理超出人類規模的任務與真實人類訊號相當複雜,OpenAI 於五個玩具演算法領域使用監督式學習測試了迭代放大。在這些實驗中,研究人員假裝不知道直接的演算法解答,模擬人類能組合解決方案的子片段卻無法提供直接訓練訊號的情境。
測試的五項任務包括:
- 置換冪次
- 連續指派
- 通配符搜尋
- 最短路徑
- 合併查找
在所有五個案例中,迭代放大的表現與直接監督式學習相當,儘管放大過程未直接取得真實標籤,仍能匹配能取得真實標籤之系統的效能。
與其他 AI 安全方法的關係
迭代放大與其他 OpenAI 安全研究在概念目標上相似,但在實作上有所不同:
- AI Safety via Debate: 兩者皆透過迭代程序與間接監督,訓練超出人類能力的任務,但採用不同的具體方法。
- Human Feedback: 迭代放大實作了獎勵預測系統,且預期在未來版本中納入直接的人類回饋。
- Expert Iteration: 雖與 AlphaGo Zero 所使用的方法相似,專家迭代是加強已有的訓練訊號,而迭代放大則是從零開始構建訓練訊號。