OpenAI 超對齊快速補助金
OpenAI 已啟動一項 $10 million 補助金計畫,以支援確保超人類 AI 系統安全與對齊的技術研究。此舉旨在解決人類如何引導和信任能力遠超人類智慧的 AI 系統的關鍵挑戰。
超人類 AI 對齊的挑戰
讓超人類 AI 系統實現對齊與目前的 AI 對齊相比,呈現出根本不同的技術挑戰。目前的系統通常透過來自人類回饋的強化學習(RLHF)來進行對齊,但此方法依賴人類監督,當 AI 能力超越人類理解時,此監督將變得不足。
超人類 AI 系統可能展現出人類無法完全評估的複雜與創造行為。例如,OpenAI 指出,如果一個超人類模型生成了數百萬行高度複雜的程式碼,人類審查者將無法可靠地判斷該程式碼是執行時安全還是危險。因此,核心的技術問題在於決定人類如何能夠對遠超自身智慧的系統保持控制與信任。
Superalignment 快速補助金計畫詳情
在與 Eric Schmidt 的合作下,OpenAI 正向學術實驗室、非營利組織和個人研究者提供 $10 million 的資金。該計畫旨在吸引既有經驗的對齊研究者以及該領域的新人。
資助層級與資格
- 一般補助金: 個人研究者、非營利組織和學術實驗室可申請介於 $100,000 與 $2 million 之間的補助金。
- OpenAI Superalignment 獎學金: 為研究生提供的一年期獎學金,包含 $75,000 的生活津貼及 $75,000 的運算與研究經費(合計 $150,000)。
- 經驗要求: 申請時無需具備 AI 對齊的先前經驗。
優先研究方向
OpenAI 已確定幾個關鍵的技術領域,他們在此尋求在對齊與安全方面的突破:
弱到強的泛化
此研究聚焦於強大模型如何從「弱」監督者(人類)的監督中進行泛化。目標是理解並控制超人類模型如何從能力較弱的實體所提供的回饋中學習。
可解釋性
可解釋性研究旨在理解 AI 模型的內部機制。此研究的一項主要應用是開發如「AI 偵測謊言」之類的工具,以驗證模型的誠實度。
可擴展監督
可擴展監督指的是利用 AI 系統協助人類操作員評估其他 AI 系統的輸出,特別是在執行超出個人人類能力的複雜任務時。
其他研究領域
OpenAI 也對以下研究領域提供資助感興趣:
- 誠實度
- 思維鏈忠實度
- 對抗鲁棒性
- 評估與測試平台
Sources
- OriginalSuperalignment Fast Grants