透過辯論的 AI 安全
OpenAI 提出一種安全技術,透過訓練 AI 代理人進行辯論,以協助人類監督執行超出人類認知能力的任務的系統。
OpenAI 演化策略梯度 (EPG)
OpenAI 介紹了演化策略梯度 (EPG),這是一種透過演化損失函數的元學習方法,協助 RL 代理人在同一任務族內泛化到新任務。
OpenAI 必須快速學習基準測試
OpenAI 推出了一個基於《刺猬索尼克》遊戲系列的新強化學習基準,用於衡量遷移學習與少樣本學習的表現。
OpenAI Retro 競賽與 Gym Retro 發布
OpenAI 推出 Retro 競賽,以衡量強化學習在未見過的電子遊戲關卡上的泛化能力,並發布了 Gym Retro,這是一個將 30 款 SEGA Genesis 與 62 款 Atari 2600 遊戲整合至 Gym 的平台。
OpenAI 基於行動依賴分解基線的策略梯度變異降低
OpenAI 研究人員開發了一種無偏差的行動依賴基線,用於策略梯度方法以降低梯度估計的變異,從而在高維度行動空間中實現更快的學習。
OpenAI OT‑GAN:使用最適傳輸改進 GAN
OpenAI 推出最適傳輸 GAN(OT‑GAN),這是一種使用新小批量能量距離度量來提升訓練穩定性與影像生成品質的生成對抗網路變體。
OpenAI 2018年3月黑客松報告
OpenAI 於 2018 年 3 月 3 日舉辦了首次黑客松,匯聚了 100 位 AI 社群成員,開發涵蓋醫療、安全與強化學習的專案。
關於一階元學習演算法
OpenAI 介紹了 Reptile,一種一階元學習演算法,透過優化參數初始化,使代理人在新任務上能快速學習,且不需要二階導數。
OpenAI Reptile:可擴展的元學習演算法
OpenAI 推出 Reptile,一種可擴展的元學習演算法,透過最大化同一任務中不同小批次梯度的內積,使模型能夠從少量範例中進行概括。
OpenAI 學者計畫
OpenAI 推出 OpenAI Scholars 計畫,為來自弱勢族群的個人提供津貼與導師指導,以學習深度學習並開源專案。
OpenAI 研究:透過元強化學習學習探索
OpenAI 研究人員推出了 E-MAML 與 E-RL²,兩種旨在提升複雜環境中探索效能的元強化學習演算法。
OpenAI 機器人研究的材料
OpenAI 發布了八個模擬機器人環境以及 Baselines 實作的 Hindsight Experience Replay (HER),以便在複雜的操作任務中從稀疏獎勵啟用強化學習。
OpenAI 多目標強化學習機器人環境
OpenAI 已發布一套具挑戰性的連續控制機器人任務,已與 OpenAI Gym 整合,以推進多目標強化學習的研究。
OpenAI 黑客松 2018 年 3 月
OpenAI 在 2018 年 3 月 3 日於舊金山舉辦了一場社區黑客松和一系列講座,以鼓勵 AI 學習與專案開發。
OpenAI 支持者與組織更新
OpenAI 宣布新捐贈者、顧問任命,以及伊隆·馬斯克離開其董事會,以避免與特斯拉在人工智慧領域的重點產生潛在衝突。
OpenAI 正為惡意使用 AI 做準備
OpenAI 與其合作夥伴發表了一篇研究論文,預測 AI 可能被惡意行為者濫用的方式,並提供緩解這些全球安全威脅的建議。
OpenAI 透過教學實現可解釋機器學習
OpenAI 提出了一種機器教學方法,該方法使用教師-學生神經網路框架來識別概念的最具說明性範例,確保所得到的解釋是人類可理解的,而不是任意的。
OpenAI 發現用於實體消歧義的類型
OpenAI 開發了一個系統,使用神經網路來預測自動發現的類型的成員資格,以提高 CoNLL 和 TAC KBP 2010 資料集上的實體消歧義準確度。
OpenAI 研究請求 2.0
OpenAI 發布了 Research Requests 2.0,這是一系列七個未解決的強化學習與機器學習技術問題,旨在鼓勵社群貢獻。
將 Kubernetes 擴展至 2,500 個節點
OpenAI 描述了為了在 Azure 上進行深度學習研究,將 Kubernetes 集群擴展至 2,500 個節點所需的技術優化,解決了 etcd、網路和鏡像拉取方面的瓶頸。
OpenAI 區塊稀疏 GPU 核心
OpenAI 已發布高度優化的 GPU 核心,適用於區塊稀疏神經網路架構,使模型能夠變得更寬更深,同時運行速度比 cuBLAS 或 cuSPARSE 快上幾個數量級。
OpenAI 透過 L0 正則化學習稀疏神經網路
OpenAI 介紹了一種在神經網路中使用 L0 範數正則化的方法,透過隨機門將權重精確設為零,以建立稀疏模型,提升訓練速度、推論速度與泛化能力。
OpenAI 可解釋且教學範例研究
OpenAI 研究人員表明,以迭代方式而非聯合方式訓練教師和學生神經網路,能產出可解釋的教學策略,該策略能有效地同時教導 AI 和人類。
OpenAI 學習階層研究
OpenAI 已開發 Meta-Learning Shared Hierarchies (MLSH),一種強化學習演算法,能自動發現高層次動作,以比暴力方法更高效的方式解決複雜的長時域任務。
OpenAI 從模擬中泛化
OpenAI 使用動態和域隨機化技術,在模擬中訓練機器人控制器,使其能夠泛化到實體機器人並對未規劃的環境變化做出反應。
OpenAI 透過動態隨機化實現機械手臂控制的 Sim-to-Real 轉移
OpenAI 研究人員開發了一種動態隨機化方法,使得僅在模擬中訓練的機械手臂控制策略能夠直接轉移到真實硬體,而無需額外的實體訓練。
OpenAI 非對稱 Actor-Critic 用於基於圖像的機器人學習
OpenAI 提出一種非對稱 Actor-Critic 框架,透過在完整模擬器狀態上訓練評論家(critic)而僅依賴 RGBD 影像的行動者(actor),從而在無需真實世界資料的情況下實現高效的模擬到真實世界遷移。
OpenAI 領域隨機化與生成模型用於機械手抓取
OpenAI 使用領域隨機化和自回歸模型開發了一個數據生成管道,僅使用模擬訓練數據,在未見物體上達成 80% 的真實世界抓取成功率。
OpenAI 元學習摔跤
OpenAI 證明了元學習代理能夠快速調整其策略以擊敗較強的固定策略代理,並在模擬機器人摔跤中從身體故障中恢復。
OpenAI 競爭自我對弈研究
OpenAI 展示競爭自我對弈使得模擬的 3D 機器人能夠自主發現如擒抱和潛水等複雜的物理技能,而無需明確的人類設計。
深度線性網路中的非線性運算
OpenAI 研究人員發現,深度線性網路可以通過利用零附近浮點運算的下溢來執行非線性運算。
OpenAI 與 Oxford 推出 LOLA 用於多智能體強化學習
OpenAI 與牛津大學開發了 Learning with Opponent-Learning Awareness (LOLA),一種能夠塑造其他智能體學習以實現互惠互利結果的強化學習代理。
OpenAI 具備對手學習意識的學習 (LOLA)
OpenAI 提出具備對手學習意識的學習 (LOLA),這是一種多智能體強化學習方法,使智能體能夠塑造其他智能體的學習,以促進合作並達到納什均衡。
OpenAI 基線: ACKTR & A2C
OpenAI 已發布 ACKTR 和 A2C 的 Baselines 實現,提供了一種更具樣本效率的強化學習演算法(ACKTR)以及 A3C 的同步確定性變體(A2C)。
OpenAI Dota 2 1v1 機器人結果
OpenAI 開發了一個強化學習代理,在 Dota 2 1v1 中達到了超人類表現,表明自我對戰可以將機器學習系統擴展到超越人類水平的能力。
OpenAI Dota 2 機器人公告
OpenAI 已開發出一個能夠在 1v1 比賽中擊敗頂尖職業 Dota 2 玩家的機器人,該機器人透過自我對戰強化學習學習,且未使用模仿學習或樹搜索。
OpenAI RL-Teacher 發布
OpenAI 已發布 RL-Teacher,一個開源介面,允許 AI 代理透過偶爾的人類回饋進行訓練,而無需手工製作的獎勵函數。
參數噪聲帶來的更好探索
OpenAI 2017 年的研究表明,為強化學習策略添加自適應參數噪聲可以改善探索並提高分數,這在 HalfCheetah 和 Atari/Mujoco 基準測試中得到驗證。
近端策略優化 (PPO) 發布說明 – OpenAI Baselines
OpenAI 發布了近端策略優化 (PPO),這是一種易於實現的強化學習算法,其表現可匹配或超越最先進的方法,並已成為 OpenAI 的預設 RL 方法。
OpenAI 強健對抗性輸入研究
OpenAI 已開發出在不同尺度與視角下仍具對抗性的圖像,這挑戰了這樣的觀念:像自駕車這類系統透過多視角圖像擷取可以防止惡意欺騙。
OpenAI 後見經驗重播
OpenAI 提出了 Hindsight Experience Replay,一種技術,通過將失敗的嘗試視為替代目標的成功實現,使得在稀疏、二元獎勵下能夠進行樣本高效的強化學習。
OpenAI 教師–學生課程學習
OpenAI 推出教師–學生課程學習(TSCL),這是一個自動化框架,透過根據學生的學習進度與表現衰退來選擇子任務,以優化訓練。
mujoco-py 1.50.1.0 版本說明 / 新功能
OpenAI 已開源 mujoco-py 1.50.1.0,這是一個高效能的 Python 3 繫結,針對 MuJoCo 引擎,引入了批次模擬與 GPU 加速渲染。
OpenAI 從人類偏好中學習
OpenAI 與 DeepMind 開發了一種從人類偏好比較推斷目標的強化學習演算法,減少了對手動編寫獎勵函數的需求。
學習合作、競爭與溝通 – OpenAI 2017 研究公告
OpenAI 在 2017 年 6 月推出 MADDPG,這是一種集中式評論家(centralized‑critic)多智能體強化學習算法,旨在讓智能體在共享環境中學習合作、競爭與溝通。
OpenAI 透過 Q-Ensembles 進行 UCB 探索
OpenAI 研究人員開發了一種基於 Upper-Confidence Bounds (UCB) 的 Q*-函數集合探索策略,以提升深度強化學習在 Atari 基準測試上的表現。
OpenAI Baselines: DQN 發布與強化學習最佳實踐
OpenAI 已開源 OpenAI Baselines,首先提供 DQN 及其三種變體的高效能實作,以提升強化學習的可重現性。
OpenAI 機器人能學習:來自模擬的一次模仿學習
OpenAI 已開發出一個完全在模擬中訓練的機器人系統,能夠透過 VR 提供的人類單次示範學習新任務。
OpenAI Roboschool 發布
OpenAI 已發布 Roboschool,一個用於強化學習的物理環境集合,將 MuJoCo 任務移植到 Bullet 物理引擎,並引入互動控制與多人訓練的新挑戰。
政策梯度與軟 Q-learning 的等價性
OpenAI 研究人員展示,軟(熵正則化)Q-learning 在數學上等價於政策梯度方法,在兩種主要的模型自由強化學習方法之間提供了理論橋樑。