OpenAI 在多代理系統中的學習政策表徵

OpenAI 推出了一個通用的學習框架,旨在對多代理系統中的代理行為進行建模。透過將代理建模視為表徵學習問題,該框架僅需少量互動資料即可理解複雜的代理行為,擺脫了針對特定任務、手工設計的領域知識。

代理建模的一般框架

本研究的核心貢獻是一個將代理行為建模視為表徵學習問題的通用學習框架。與以往依賴手工設計、領域特定先驗知識的方法不同,這個框架旨在適用於任何多代理系統。

為了實現此目標,研究人員開發了一種受模仿學習與代理識別啟發的全新目標。此目標允許在無監督的情況下學習代理策略的表徵,使系統能在沒有明確標籤的情況下辨識與分類代理行為。

實證效用與應用

所提出框架的效用在兩種不同類型的環境中得到驗證:

高維度競爭環境

在一個聚焦於連續控制的具挑戰性的高維度競爭環境中,該框架被用於執行監督式預測任務以及代理行為的無監督聚類。

合作式通訊環境

在一個為通訊設計的合作環境中,該框架同樣應用於監督式預測任務、無監督聚類,以及使用深度強化學習的策略優化。

對多代理系統的關鍵意涵

透過實現策略表徵的無監督學習,這個框架提供了一個理解多代理系統中複雜現象產生的工具。它減少了對手動特徵工程的依賴,並透過利用其他代理行為的學習表徵,使深度強化學習在策略優化上更加高效。

Sources