將 Kubernetes 擴展至 2,500 個節點
OpenAI 描述了為了在 Azure 上進行深度學習研究,將 Kubernetes 集群擴展至 2,500 個節點所需的技術優化,解決了 etcd、網路和鏡像拉取方面的瓶頸。
OpenAI 區塊稀疏 GPU 核心
OpenAI 已發布高度優化的 GPU 核心,適用於區塊稀疏神經網路架構,使模型能夠變得更寬更深,同時運行速度比 cuBLAS 或 cuSPARSE 快上幾個數量級。
OpenAI 透過 L0 正則化學習稀疏神經網路
OpenAI 介紹了一種在神經網路中使用 L0 範數正則化的方法,透過隨機門將權重精確設為零,以建立稀疏模型,提升訓練速度、推論速度與泛化能力。
OpenAI 可解釋且教學範例研究
OpenAI 研究人員表明,以迭代方式而非聯合方式訓練教師和學生神經網路,能產出可解釋的教學策略,該策略能有效地同時教導 AI 和人類。
OpenAI 學習階層研究
OpenAI 已開發 Meta-Learning Shared Hierarchies (MLSH),一種強化學習演算法,能自動發現高層次動作,以比暴力方法更高效的方式解決複雜的長時域任務。
OpenAI 從模擬中泛化
OpenAI 使用動態和域隨機化技術,在模擬中訓練機器人控制器,使其能夠泛化到實體機器人並對未規劃的環境變化做出反應。
OpenAI 透過動態隨機化實現機械手臂控制的 Sim-to-Real 轉移
OpenAI 研究人員開發了一種動態隨機化方法,使得僅在模擬中訓練的機械手臂控制策略能夠直接轉移到真實硬體,而無需額外的實體訓練。
OpenAI 非對稱 Actor-Critic 用於基於圖像的機器人學習
OpenAI 提出一種非對稱 Actor-Critic 框架,透過在完整模擬器狀態上訓練評論家(critic)而僅依賴 RGBD 影像的行動者(actor),從而在無需真實世界資料的情況下實現高效的模擬到真實世界遷移。
OpenAI 領域隨機化與生成模型用於機械手抓取
OpenAI 使用領域隨機化和自回歸模型開發了一個數據生成管道,僅使用模擬訓練數據,在未見物體上達成 80% 的真實世界抓取成功率。
OpenAI 元學習摔跤
OpenAI 證明了元學習代理能夠快速調整其策略以擊敗較強的固定策略代理,並在模擬機器人摔跤中從身體故障中恢復。
OpenAI 競爭自我對弈研究
OpenAI 展示競爭自我對弈使得模擬的 3D 機器人能夠自主發現如擒抱和潛水等複雜的物理技能,而無需明確的人類設計。
深度線性網路中的非線性運算
OpenAI 研究人員發現,深度線性網路可以通過利用零附近浮點運算的下溢來執行非線性運算。
OpenAI 與 Oxford 推出 LOLA 用於多智能體強化學習
OpenAI 與牛津大學開發了 Learning with Opponent-Learning Awareness (LOLA),一種能夠塑造其他智能體學習以實現互惠互利結果的強化學習代理。
OpenAI 具備對手學習意識的學習 (LOLA)
OpenAI 提出具備對手學習意識的學習 (LOLA),這是一種多智能體強化學習方法,使智能體能夠塑造其他智能體的學習,以促進合作並達到納什均衡。
OpenAI 基線: ACKTR & A2C
OpenAI 已發布 ACKTR 和 A2C 的 Baselines 實現,提供了一種更具樣本效率的強化學習演算法(ACKTR)以及 A3C 的同步確定性變體(A2C)。
OpenAI Dota 2 1v1 機器人結果
OpenAI 開發了一個強化學習代理,在 Dota 2 1v1 中達到了超人類表現,表明自我對戰可以將機器學習系統擴展到超越人類水平的能力。
OpenAI Dota 2 機器人公告
OpenAI 已開發出一個能夠在 1v1 比賽中擊敗頂尖職業 Dota 2 玩家的機器人,該機器人透過自我對戰強化學習學習,且未使用模仿學習或樹搜索。
OpenAI RL-Teacher 發布
OpenAI 已發布 RL-Teacher,一個開源介面,允許 AI 代理透過偶爾的人類回饋進行訓練,而無需手工製作的獎勵函數。
OpenAI 使用參數雜訊實現更好的探索
OpenAI 引入了一種在神經網路參數而非動作空間中加入適應性雜訊的方法,顯著提升了強化學習的性能和探索一致性。
近端策略優化 (PPO) 發布說明 – OpenAI Baselines
OpenAI 發布了近端策略優化 (PPO),這是一種易於實現的強化學習算法,其表現可匹配或超越最先進的方法,並已成為 OpenAI 的預設 RL 方法。
OpenAI 強健對抗性輸入研究
OpenAI 已開發出在不同尺度與視角下仍具對抗性的圖像,這挑戰了這樣的觀念:像自駕車這類系統透過多視角圖像擷取可以防止惡意欺騙。
OpenAI 後見經驗重播
OpenAI 提出了 Hindsight Experience Replay,一種技術,通過將失敗的嘗試視為替代目標的成功實現,使得在稀疏、二元獎勵下能夠進行樣本高效的強化學習。
OpenAI 教師–學生課程學習
OpenAI 推出教師–學生課程學習(TSCL),這是一個自動化框架,透過根據學生的學習進度與表現衰退來選擇子任務,以優化訓練。
mujoco-py 1.50.1.0 版本說明 / 新功能
OpenAI 已開源 mujoco-py 1.50.1.0,這是一個高效能的 Python 3 繫結,針對 MuJoCo 引擎,引入了批次模擬與 GPU 加速渲染。
OpenAI 從人類偏好中學習
OpenAI 與 DeepMind 開發了一種從人類偏好比較推斷目標的強化學習演算法,減少了對手動編寫獎勵函數的需求。
OpenAI MADDPG: 學習合作、競爭與溝通
OpenAI 推出了 MADDPG,這是一種強化學習演算法,透過使用集中式學習與分散式執行,使多個代理人能夠在複雜環境中進行協作與競爭。
OpenAI 透過 Q-Ensembles 進行 UCB 探索
OpenAI 研究人員開發了一種基於 Upper-Confidence Bounds (UCB) 的 Q*-函數集合探索策略,以提升深度強化學習在 Atari 基準測試上的表現。
OpenAI Baselines: DQN 發布與強化學習最佳實踐
OpenAI 已開源 OpenAI Baselines,首先提供 DQN 及其三種變體的高效能實作,以提升強化學習的可重現性。
OpenAI 機器人能學習:來自模擬的一次模仿學習
OpenAI 已開發出一個完全在模擬中訓練的機器人系統,能夠透過 VR 提供的人類單次示範學習新任務。
OpenAI Roboschool 發布
OpenAI 已發布 Roboschool,一個用於強化學習的物理環境集合,將 MuJoCo 任務移植到 Bullet 物理引擎,並引入互動控制與多人訓練的新挑戰。
政策梯度與軟 Q-learning 的等價性
OpenAI 研究人員展示,軟(熵正則化)Q-learning 在數學上等價於政策梯度方法,在兩種主要的模型自由強化學習方法之間提供了理論橋樑。
隨機神經網路用於階層強化學習
OpenAI 研究者提出一種框架,利用隨機神經網路和資訊論正則化器來預訓練可解釋的技能,以加速在稀疏獎勵的下游任務中的學習。
OpenAI 無監督情緒神經元
OpenAI 開發了一個無監督系統,該系統透過預測 Amazon 評論中的下一個字元來學習情緒表示,在 Stanford Sentiment Treebank 上達到最先進的準確率,且所需標註樣本顯著減少。
OpenAI 在實體世界中的 Spam 偵測
OpenAI 開發出一個機器人系統,能夠使用完全在模擬中經過域隨機化訓練的 VGG16 基礎神經網路來偵測實體的 Spam 罐頭。
演化策略作為強化學習的可擴展替代方案
OpenAI 研究人員證明,演化策略(ES)在 Atari 和 MuJoCo 基準測試上能與標準強化學習的表現相媲美,同時提供更優的可擴展性和更簡單的實現。
OpenAI 一次模仿學習
OpenAI 提出了一個用於一次模仿學習的元學習框架,使機器人能夠從單次示範中學習新任務,並在無需特定任務工程的情況下推廣到新情境。
OpenAI 支持 Distill 期刊啟動
OpenAI 宣布其支持 Distill,這是一個利用現代網路技術來改進機器學習結果溝通的新期刊。
學習溝通:OpenAI 2017 年對新興 AI 語言的研究
OpenAI 的 2017 年『學習溝通』研究顯示,強化學習代理人可以發明一種基礎且組合式的語言,以在簡單的模擬世界中解決合作任務。
多智能體族群中基礎組合語言的出現
OpenAI 研究人員表明,基礎組合語言可以在多智能體族群中出現,展示了代理人如何發展結構化的符號基礎溝通系統以實現目標。
OpenAI 使用時間段模型進行預測與控制
OpenAI 提出一種深度生成模型,該模型在時間段而非離散時間步上預測未來狀態軌跡,從而在複雜非線性系統中實現穩定的長期預測。
OpenAI 第三人稱模仿學習
OpenAI 提出一種無監督的第三人稱模仿學習方法,使得代理能夠從不同視角提供的示範中學習任務,而無需明確的狀態對應。
使用對抗樣本攻擊機器學習
OpenAI 探討如何故意設計的輸入(對抗樣本)導致機器學習模型失誤,凸顯監督學習與強化學習中的關鍵漏洞,對 AI 安全構成重大挑戰。
對神經網路政策的對抗性攻擊
OpenAI 研究人員展示,強化學習中的神經網路政策對小而不可感知的對抗性擾動具有脆弱性,這些擾動會在各種任務和訓練演算法中顯著降低性能。
OpenAI 團隊更新 2017年1月
OpenAI 在 2017 年 1 月將團隊擴充至 45 人,新增機器人、分散式系統和優化領域的專家,以推進 AI 能力。
PixelCNN++: 改進 PixelCNN,使用離散化 logistic 混合 likelihood 與其他修改
OpenAI 發布了 PixelCNN++,這是一個增強的 PixelCNN 實作,將 256‑way softmax 替換為離散化 logistic 混合 likelihood,條件於整像素,加入下採樣、捷徑連接和 dropout,在 CIFAR‑10 上達成最先進的 log likelihood。
OpenAI: 野外的錯誤獎勵函數
OpenAI 識別出強化學習中獎勵錯誤指定的風險,其中代理利用不完美的代理指標通過非預期行為獲得高分。
OpenAI Universe is a general-purpose AI training platform that allows agents to interact with any computer program via screen pixels and virtual keyboard/mouse inputs to foster the development of general intelligence.
OpenAI 與 Microsoft 合作夥伴公告
OpenAI 已與 Microsoft 合作,將 Azure 作為其深度學習與 AI 研究的主要雲端平台,以加速其實驗規模。
OpenAI 關於深度強化學習的基於計數的探索研究
OpenAI 研究人員已經展示,經典基於計數探索的簡單推廣,使用雜湊碼將高維狀態映射到計數,可以在深度強化學習中達到接近最先進的性能。
關於解碼器生成模型的定量分析
OpenAI 研究人員提出使用 Annealed Importance Sampling 來準確評估解碼器生成模型的對數似然,以解決僅靠樣本檢查難以量化性能的問題。