Hugging Face AI vs. AI:多代理強化學習競賽系統
Hugging Face 推出了 AI vs. AI,一個開源系統,旨在於多代理環境中對深度強化學習(RL)模型的實力進行排名。透過促進代理之間的持續競爭,該系統提供相對的技能衡量指標,以及一種強健的評估方法,能夠在多樣化的行為範圍內測試策略。
系統架構與組件
AI vs. AI 由三個主要技術要素組成,皆部署於 Hugging Face 基礎設施上:
- Hugging Face Space: 使用配對演算法與排程器,在免費硬體上以背景任務執行模型對戰。
- Hugging Face Dataset: 作為持久層,儲存比賽歷史與模型評分。
- Leaderboard: 一個公開介面,從資料集取得比賽結果,顯示模型目前的 ELO 評分。
當使用者將訓練好的模型推送至 Hub 時,系統會自動對其進行評估,並與其他已提交的代理進行排名比較。
ELO 評分與配對演算法
AI vs. AI 並未依賴客觀指標,而是使用 ELO 評分系統 來建立相對的技能衡量。在此實作中,系統會將所有新模型的起始評分設定為任意的 1200。為了維持整體池子的平均 ELO 恒定,得分與失分採對稱方式(例如 +10 與 -10)。
配對流程
配對演算法透過以下步驟,確保多樣性與競爭平衡:
- 模型收集: 從 Hub 收集所有可用模型。
- 佇列建立: 將模型放入佇列。
- 配對: 系統取出佇列中的第一個模型,並從評分最接近的 $n$ 個模型中隨機選取一個模型進行配對。
- 模擬: 在環境中(例如 Unity 可執行檔)模擬比賽,並將結果記錄於 Hugging Face Dataset。
- 評分更新: 根據比賽結果套用 ELO 公式,更新雙方的評分。
- 迭代: 重複此流程直至佇列為空,然後重新開始新一輪循環。
實作:SoccerTwos 挑戰
為了示範此系統,Hugging Face 在其深度強化學習課程第 7 單元中實作了 SoccerTwos Challenge。此挑戰使用 Unity ML-Agents 環境,2 對 2 的足球隊必須合作進球。
- 視覺示範: 專屬的 Space 讓使用者可選擇兩支隊伍,並即時觀看比賽畫面。
- 社群互動: 專屬的 Discord 頻道 (
ai-vs-ai-competition) 用於分享建議與交流見解。
泛化與未來應用
由於 AI vs. AI 系統是 環境無關 的,它可應用於任何對抗式多代理情境。Hugging Face 計畫將此工具擴展至支援其他環境,包括來自 PettingZoo 的環境以及自訂環境如「SnowballFight」。
透過讓代理與多樣化的策略對戰,該系統成為一種強健的評估方法,提供對策略品質的全方位觀察,而傳統的靜態指標可能無法捕捉。