Hugging Face AI vs. AI:多代理強化學習競賽系統

Hugging Face 推出了 AI vs. AI,一個開源系統,旨在於多代理環境中對深度強化學習(RL)模型的實力進行排名。透過促進代理之間的持續競爭,該系統提供相對的技能衡量指標,以及一種強健的評估方法,能夠在多樣化的行為範圍內測試策略。

系統架構與組件

AI vs. AI 由三個主要技術要素組成,皆部署於 Hugging Face 基礎設施上:

  • Hugging Face Space: 使用配對演算法與排程器,在免費硬體上以背景任務執行模型對戰。
  • Hugging Face Dataset: 作為持久層,儲存比賽歷史與模型評分。
  • Leaderboard: 一個公開介面,從資料集取得比賽結果,顯示模型目前的 ELO 評分。

當使用者將訓練好的模型推送至 Hub 時,系統會自動對其進行評估,並與其他已提交的代理進行排名比較。

ELO 評分與配對演算法

AI vs. AI 並未依賴客觀指標,而是使用 ELO 評分系統 來建立相對的技能衡量。在此實作中,系統會將所有新模型的起始評分設定為任意的 1200。為了維持整體池子的平均 ELO 恒定,得分與失分採對稱方式(例如 +10 與 -10)。

配對流程

配對演算法透過以下步驟,確保多樣性與競爭平衡:

  1. 模型收集: 從 Hub 收集所有可用模型。
  2. 佇列建立: 將模型放入佇列。
  3. 配對: 系統取出佇列中的第一個模型,並從評分最接近的 $n$ 個模型中隨機選取一個模型進行配對。
  4. 模擬: 在環境中(例如 Unity 可執行檔)模擬比賽,並將結果記錄於 Hugging Face Dataset。
  5. 評分更新: 根據比賽結果套用 ELO 公式,更新雙方的評分。
  6. 迭代: 重複此流程直至佇列為空,然後重新開始新一輪循環。

實作:SoccerTwos 挑戰

為了示範此系統,Hugging Face 在其深度強化學習課程第 7 單元中實作了 SoccerTwos Challenge。此挑戰使用 Unity ML-Agents 環境,2 對 2 的足球隊必須合作進球。

  • 視覺示範: 專屬的 Space 讓使用者可選擇兩支隊伍,並即時觀看比賽畫面。
  • 社群互動: 專屬的 Discord 頻道 (ai-vs-ai-competition) 用於分享建議與交流見解。

泛化與未來應用

由於 AI vs. AI 系統是 環境無關 的,它可應用於任何對抗式多代理情境。Hugging Face 計畫將此工具擴展至支援其他環境,包括來自 PettingZoo 的環境以及自訂環境如「SnowballFight」。

透過讓代理與多樣化的策略對戰,該系統成為一種強健的評估方法,提供對策略品質的全方位觀察,而傳統的靜態指標可能無法捕捉。

Sources