OpenAI Dota 2 機器人公告
OpenAI 已創建一個 AI 機器人,在標準賽事規則下的 1v1 比賽中擊敗世界頂尖職業 Dota 2 玩家。此成就展示了 AI 系統在涉及人類對手的複雜且混亂環境中實現明確定義目標的能力。
技術方法與學習方法
OpenAI Dota 2 機器人完全透過自我對戰從零開始學習遊戲。該系統不依賴模仿學習——即 AI 透過模仿人類數據來學習——也不使用樹搜索。
由於 Dota 2 是一個隱藏資訊的遊戲,機器人必須發展高層次認知策略才能成功。這些策略包括:
- Predictive Planning: 機器人學會預測對手移動。
- Adaptability: 系統能在面對不熟悉情況時即興應變。
- ** uma Influence**: 機器人學會如何影響友軍單位以協助其目標。
- Strategic Deception: 代理人學會規劃、攻擊、欺騙和欺詐對手以獲得優勢。
效能與人類基準
機器人的成功並非基於機械優勢或高每分鐘動作數(APM)。OpenAI 報告指出,該機器人的 APM 與平均人類玩家相當,這表明 Dota 1v1 中玩家技能與 APM 的相關性並不強。
在競爭測試中,該機器人在一週內對抗數位頂尖職業選手時保持不敗,包括:
- Dendi: 機器人在 The International 主要舞台上與 Dendi 進行三局兩勝賽並獲勝。
- SumaiL: 機器人擊敗 SumaiL,該選手被譽為世界頂尖 1v1 玩家。
- Arteezy: 機器人擊敗 Arteezy,該選手被譽為世界頂尖整體玩家。
未來目標
雖然當前里程碑專注於 1v1 比賽,但 Dota 2 的完整遊戲是一種以五人兩隊為基礎的團隊競賽,擁有超過一百位英雄和數百種物品可供選擇。OpenAI 宣稱的下一步是開發一支能夠與頂尖人類隊伍競爭並協作的 Dota 2 機器人團隊。
Sources
- OriginalDota 2