2101

OpenAI 必須快速學習基準測試

OpenAI 推出了一個基於《刺猬索尼克》遊戲系列的新強化學習基準,用於衡量遷移學習與少樣本學習的表現。

2102

OpenAI Retro 競賽與 Gym Retro 發布

OpenAI 推出 Retro 競賽,以衡量強化學習在未見過的電子遊戲關卡上的泛化能力,並發布了 Gym Retro,這是一個將 30 款 SEGA Genesis 與 62 款 Atari 2600 遊戲整合至 Gym 的平台。

2103

OpenAI 基於行動依賴分解基線的策略梯度變異降低

OpenAI 研究人員開發了一種無偏差的行動依賴基線,用於策略梯度方法以降低梯度估計的變異,從而在高維度行動空間中實現更快的學習。

2104

OpenAI OT‑GAN:使用最適傳輸改進 GAN

OpenAI 推出最適傳輸 GAN(OT‑GAN),這是一種使用新小批量能量距離度量來提升訓練穩定性與影像生成品質的生成對抗網路變體。

2105

OpenAI 2018年3月黑客松報告

OpenAI 於 2018 年 3 月 3 日舉辦了首次黑客松,匯聚了 100 位 AI 社群成員,開發涵蓋醫療、安全與強化學習的專案。

2106

關於一階元學習演算法

OpenAI 介紹了 Reptile,一種一階元學習演算法,透過優化參數初始化,使代理人在新任務上能快速學習,且不需要二階導數。

2107

OpenAI Reptile:可擴展的元學習演算法

OpenAI 推出 Reptile,一種可擴展的元學習演算法,透過最大化同一任務中不同小批次梯度的內積,使模型能夠從少量範例中進行概括。

2108

OpenAI 學者計畫

OpenAI 推出 OpenAI Scholars 計畫,為來自弱勢族群的個人提供津貼與導師指導,以學習深度學習並開源專案。

2109

OpenAI 研究:透過元強化學習學習探索

OpenAI 研究人員推出了 E-MAML 與 E-RL²,兩種旨在提升複雜環境中探索效能的元強化學習演算法。

2110

OpenAI 機器人研究的材料

OpenAI 發布了八個模擬機器人環境以及 Baselines 實作的 Hindsight Experience Replay (HER),以便在複雜的操作任務中從稀疏獎勵啟用強化學習。

2111

OpenAI 多目標強化學習機器人環境

OpenAI 已發布一套具挑戰性的連續控制機器人任務,已與 OpenAI Gym 整合,以推進多目標強化學習的研究。

2112

OpenAI 黑客松 2018 年 3 月

OpenAI 在 2018 年 3 月 3 日於舊金山舉辦了一場社區黑客松和一系列講座,以鼓勵 AI 學習與專案開發。

2113

OpenAI 支持者與組織更新

OpenAI 宣布新捐贈者、顧問任命,以及伊隆·馬斯克離開其董事會,以避免與特斯拉在人工智慧領域的重點產生潛在衝突。

2114

OpenAI 正為惡意使用 AI 做準備

OpenAI 與其合作夥伴發表了一篇研究論文,預測 AI 可能被惡意行為者濫用的方式,並提供緩解這些全球安全威脅的建議。

2115

OpenAI 透過教學實現可解釋機器學習

OpenAI 提出了一種機器教學方法,該方法使用教師-學生神經網路框架來識別概念的最具說明性範例,確保所得到的解釋是人類可理解的,而不是任意的。

2116

OpenAI 發現用於實體消歧義的類型

OpenAI 開發了一個系統,使用神經網路來預測自動發現的類型的成員資格,以提高 CoNLL 和 TAC KBP 2010 資料集上的實體消歧義準確度。

2117

OpenAI 研究請求 2.0

OpenAI 發布了 Research Requests 2.0,這是一系列七個未解決的強化學習與機器學習技術問題,旨在鼓勵社群貢獻。

2118

將 Kubernetes 擴展至 2,500 個節點

OpenAI 描述了為了在 Azure 上進行深度學習研究,將 Kubernetes 集群擴展至 2,500 個節點所需的技術優化,解決了 etcd、網路和鏡像拉取方面的瓶頸。

2119

OpenAI 區塊稀疏 GPU 核心

OpenAI 已發布高度優化的 GPU 核心,適用於區塊稀疏神經網路架構,使模型能夠變得更寬更深,同時運行速度比 cuBLAS 或 cuSPARSE 快上幾個數量級。

2120

OpenAI 透過 L0 正則化學習稀疏神經網路

OpenAI 介紹了一種在神經網路中使用 L0 範數正則化的方法,透過隨機門將權重精確設為零,以建立稀疏模型,提升訓練速度、推論速度與泛化能力。

2121

OpenAI 可解釋且教學範例研究

OpenAI 研究人員表明,以迭代方式而非聯合方式訓練教師和學生神經網路,能產出可解釋的教學策略,該策略能有效地同時教導 AI 和人類。

2122

OpenAI 學習階層研究

OpenAI 已開發 Meta-Learning Shared Hierarchies (MLSH),一種強化學習演算法,能自動發現高層次動作,以比暴力方法更高效的方式解決複雜的長時域任務。

2123

OpenAI 從模擬中泛化

OpenAI 使用動態和域隨機化技術,在模擬中訓練機器人控制器,使其能夠泛化到實體機器人並對未規劃的環境變化做出反應。

2124

OpenAI 透過動態隨機化實現機械手臂控制的 Sim-to-Real 轉移

OpenAI 研究人員開發了一種動態隨機化方法,使得僅在模擬中訓練的機械手臂控制策略能夠直接轉移到真實硬體,而無需額外的實體訓練。

2125

OpenAI 非對稱 Actor-Critic 用於基於圖像的機器人學習

OpenAI 提出一種非對稱 Actor-Critic 框架,透過在完整模擬器狀態上訓練評論家(critic)而僅依賴 RGBD 影像的行動者(actor),從而在無需真實世界資料的情況下實現高效的模擬到真實世界遷移。

2126

OpenAI 領域隨機化與生成模型用於機械手抓取

OpenAI 使用領域隨機化和自回歸模型開發了一個數據生成管道,僅使用模擬訓練數據,在未見物體上達成 80% 的真實世界抓取成功率。

2127

OpenAI 元學習摔跤

OpenAI 證明了元學習代理能夠快速調整其策略以擊敗較強的固定策略代理,並在模擬機器人摔跤中從身體故障中恢復。

2128

OpenAI 競爭自我對弈研究

OpenAI 展示競爭自我對弈使得模擬的 3D 機器人能夠自主發現如擒抱和潛水等複雜的物理技能,而無需明確的人類設計。

2129

深度線性網路中的非線性運算

OpenAI 研究人員發現,深度線性網路可以通過利用零附近浮點運算的下溢來執行非線性運算。

2130

OpenAI 與 Oxford 推出 LOLA 用於多智能體強化學習

OpenAI 與牛津大學開發了 Learning with Opponent-Learning Awareness (LOLA),一種能夠塑造其他智能體學習以實現互惠互利結果的強化學習代理。

2131

OpenAI 具備對手學習意識的學習 (LOLA)

OpenAI 提出具備對手學習意識的學習 (LOLA),這是一種多智能體強化學習方法,使智能體能夠塑造其他智能體的學習,以促進合作並達到納什均衡。

2132

OpenAI 基線: ACKTR & A2C

OpenAI 已發布 ACKTR 和 A2C 的 Baselines 實現,提供了一種更具樣本效率的強化學習演算法(ACKTR)以及 A3C 的同步確定性變體(A2C)。

2133

OpenAI Dota 2 1v1 機器人結果

OpenAI 開發了一個強化學習代理,在 Dota 2 1v1 中達到了超人類表現,表明自我對戰可以將機器學習系統擴展到超越人類水平的能力。

2134

OpenAI Dota 2 機器人公告

OpenAI 已開發出一個能夠在 1v1 比賽中擊敗頂尖職業 Dota 2 玩家的機器人,該機器人透過自我對戰強化學習學習,且未使用模仿學習或樹搜索。

2135

OpenAI RL-Teacher 發布

OpenAI 已發布 RL-Teacher,一個開源介面,允許 AI 代理透過偶爾的人類回饋進行訓練,而無需手工製作的獎勵函數。

2136

OpenAI 使用參數雜訊實現更好的探索

OpenAI 引入了一種在神經網路參數而非動作空間中加入適應性雜訊的方法,顯著提升了強化學習的性能和探索一致性。

2137

近端策略優化 (PPO) 發布說明 – OpenAI Baselines

OpenAI 發布了近端策略優化 (PPO),這是一種易於實現的強化學習算法,其表現可匹配或超越最先進的方法,並已成為 OpenAI 的預設 RL 方法。

2138

OpenAI 強健對抗性輸入研究

OpenAI 已開發出在不同尺度與視角下仍具對抗性的圖像,這挑戰了這樣的觀念:像自駕車這類系統透過多視角圖像擷取可以防止惡意欺騙。

2139

OpenAI 後見經驗重播

OpenAI 提出了 Hindsight Experience Replay,一種技術,通過將失敗的嘗試視為替代目標的成功實現,使得在稀疏、二元獎勵下能夠進行樣本高效的強化學習。

2140

OpenAI 教師–學生課程學習

OpenAI 推出教師–學生課程學習(TSCL),這是一個自動化框架,透過根據學生的學習進度與表現衰退來選擇子任務,以優化訓練。

2141

mujoco-py 1.50.1.0 版本說明 / 新功能

OpenAI 已開源 mujoco-py 1.50.1.0,這是一個高效能的 Python 3 繫結,針對 MuJoCo 引擎,引入了批次模擬與 GPU 加速渲染。

2142

OpenAI 從人類偏好中學習

OpenAI 與 DeepMind 開發了一種從人類偏好比較推斷目標的強化學習演算法,減少了對手動編寫獎勵函數的需求。

2143

OpenAI MADDPG: 學習合作、競爭與溝通

OpenAI 推出了 MADDPG,這是一種強化學習演算法,透過使用集中式學習與分散式執行,使多個代理人能夠在複雜環境中進行協作與競爭。

2144

OpenAI 透過 Q-Ensembles 進行 UCB 探索

OpenAI 研究人員開發了一種基於 Upper-Confidence Bounds (UCB) 的 Q*-函數集合探索策略,以提升深度強化學習在 Atari 基準測試上的表現。

2145

OpenAI Baselines: DQN 發布與強化學習最佳實踐

OpenAI 已開源 OpenAI Baselines,首先提供 DQN 及其三種變體的高效能實作,以提升強化學習的可重現性。

2146

OpenAI 機器人能學習:來自模擬的一次模仿學習

OpenAI 已開發出一個完全在模擬中訓練的機器人系統,能夠透過 VR 提供的人類單次示範學習新任務。

2147

OpenAI Roboschool 發布

OpenAI 已發布 Roboschool,一個用於強化學習的物理環境集合,將 MuJoCo 任務移植到 Bullet 物理引擎,並引入互動控制與多人訓練的新挑戰。

2148

政策梯度與軟 Q-learning 的等價性

OpenAI 研究人員展示,軟(熵正則化)Q-learning 在數學上等價於政策梯度方法,在兩種主要的模型自由強化學習方法之間提供了理論橋樑。

2149

隨機神經網路用於階層強化學習

OpenAI 研究者提出一種框架,利用隨機神經網路和資訊論正則化器來預訓練可解釋的技能,以加速在稀疏獎勵的下游任務中的學習。

2150

OpenAI 無監督情緒神經元

OpenAI 開發了一個無監督系統,該系統透過預測 Amazon 評論中的下一個字元來學習情緒表示,在 Stanford Sentiment Treebank 上達到最先進的準確率,且所需標註樣本顯著減少。