OpenAI Roboschool 發布
OpenAI 已發布 Roboschool,一個用於強化學習的物理環境集合,將 MuJoCo 任務移植到 Bullet 物理引擎,並引入互動控制與多人訓練的新挑戰。
政策梯度與軟 Q-learning 的等價性
OpenAI 研究人員展示,軟(熵正則化)Q-learning 在數學上等價於政策梯度方法,在兩種主要的模型自由強化學習方法之間提供了理論橋樑。
隨機神經網路用於階層強化學習
OpenAI 研究者提出一種框架,利用隨機神經網路和資訊論正則化器來預訓練可解釋的技能,以加速在稀疏獎勵的下游任務中的學習。
OpenAI 無監督情緒神經元
OpenAI 開發了一個無監督系統,該系統透過預測 Amazon 評論中的下一個字元來學習情緒表示,在 Stanford Sentiment Treebank 上達到最先進的準確率,且所需標註樣本顯著減少。
OpenAI 在實體世界中的 Spam 偵測
OpenAI 開發出一個機器人系統,能夠使用完全在模擬中經過域隨機化訓練的 VGG16 基礎神經網路來偵測實體的 Spam 罐頭。
演化策略作為強化學習的可擴展替代方案
OpenAI 研究人員證明,演化策略(ES)在 Atari 和 MuJoCo 基準測試上能與標準強化學習的表現相媲美,同時提供更優的可擴展性和更簡單的實現。
OpenAI 一次模仿學習
OpenAI 提出了一個用於一次模仿學習的元學習框架,使機器人能夠從單次示範中學習新任務,並在無需特定任務工程的情況下推廣到新情境。
OpenAI 支持 Distill 期刊啟動
OpenAI 宣布其支持 Distill,這是一個利用現代網路技術來改進機器學習結果溝通的新期刊。
學習溝通:OpenAI 2017 年對新興 AI 語言的研究
OpenAI 的 2017 年『學習溝通』研究顯示,強化學習代理人可以發明一種基礎且組合式的語言,以在簡單的模擬世界中解決合作任務。
多智能體族群中基礎組合語言的出現
OpenAI 研究人員表明,基礎組合語言可以在多智能體族群中出現,展示了代理人如何發展結構化的符號基礎溝通系統以實現目標。
OpenAI 使用時間段模型進行預測與控制
OpenAI 提出一種深度生成模型,該模型在時間段而非離散時間步上預測未來狀態軌跡,從而在複雜非線性系統中實現穩定的長期預測。
OpenAI 第三人稱模仿學習
OpenAI 提出一種無監督的第三人稱模仿學習方法,使得代理能夠從不同視角提供的示範中學習任務,而無需明確的狀態對應。
使用對抗樣本攻擊機器學習
OpenAI 探討如何故意設計的輸入(對抗樣本)導致機器學習模型失誤,凸顯監督學習與強化學習中的關鍵漏洞,對 AI 安全構成重大挑戰。
對神經網路政策的對抗性攻擊
OpenAI 研究人員展示,強化學習中的神經網路政策對小而不可感知的對抗性擾動具有脆弱性,這些擾動會在各種任務和訓練演算法中顯著降低性能。
OpenAI 團隊更新 2017年1月
OpenAI 在 2017 年 1 月將團隊擴充至 45 人,新增機器人、分散式系統和優化領域的專家,以推進 AI 能力。
PixelCNN++: 改進 PixelCNN,使用離散化 logistic 混合 likelihood 與其他修改
OpenAI 發布了 PixelCNN++,這是一個增強的 PixelCNN 實作,將 256‑way softmax 替換為離散化 logistic 混合 likelihood,條件於整像素,加入下採樣、捷徑連接和 dropout,在 CIFAR‑10 上達成最先進的 log likelihood。
OpenAI: 野外的錯誤獎勵函數
OpenAI 識別出強化學習中獎勵錯誤指定的風險,其中代理利用不完美的代理指標通過非預期行為獲得高分。
OpenAI Universe is a general-purpose AI training platform that allows agents to interact with any computer program via screen pixels and virtual keyboard/mouse inputs to foster the development of general intelligence.
OpenAI 與 Microsoft 合作夥伴公告
OpenAI 已與 Microsoft 合作,將 Azure 作為其深度學習與 AI 研究的主要雲端平台,以加速其實驗規模。
OpenAI 關於深度強化學習的基於計數的探索研究
OpenAI 研究人員已經展示,經典基於計數探索的簡單推廣,使用雜湊碼將高維狀態映射到計數,可以在深度強化學習中達到接近最先進的性能。
關於解碼器生成模型的定量分析
OpenAI 研究人員提出使用 Annealed Importance Sampling 來準確評估解碼器生成模型的對數似然,以解決僅靠樣本檢查難以量化性能的問題。
OpenAI:GANs、逆向強化學習與能量模型之間的聯繫
OpenAI 研究人員證明,某些逆向強化學習 (IRL) 方法(特別是最大熵 IRL)在數學上與生成對抗網路 (GANs) 和能量模型 (EBMs) 是等價的。
OpenAI RL²: 透過慢速強化學習實現快速強化學習
OpenAI 提出 RL²,這是一種使用遞迴神經網路(RNN)來學習強化學習演算法的方法,透過將學習過程本身編碼到 RNN 權重中,使代理能在僅需數次試驗的情況下適應新任務。
OpenAI 變分損失自動編碼器研究
OpenAI 提出了一種變分損失自動編碼器,它將 VAE 與神經自回歸模型結合,以學習全域表示同時捨棄如圖像紋理這樣的無關局部細節。
OpenAI Neural GPU: 擴展與限制
OpenAI 研究人員透過課程學習和增加模型規模,提升了 Neural GPU 學習如十進位算術和複雜表達式等演算法任務的能力。
OpenAI 半監督式知識傳遞用於私密訓練資料
OpenAI 提出 Private Aggregation of Teacher Ensembles (PATE),一種利用教師模型間的帶噪投票來訓練學生模型,並提供強大的差分隱私保證的框架。
OpenAI 自組織機器學習會議 (SOCML)
OpenAI 舉辦了其首次自組織機器學習會議,透過同儕間教育和 150 名 AI 從業者之間的偶然互動來加速 AI 研究。
透過學習深度逆動力模型從模擬轉移到真實世界 – OpenAI 2016
OpenAI 研究者提出了一種方法,透過學習深度逆動力模型將模擬學習到的控制策略映射到適當的真實世界動作,從而減少模擬到真實世界的差距,而無需精確的動力模型。
OpenAI 深度學習基礎設施與 Kubernetes-EC2 自動擴縮器
OpenAI 發布了其深度學習基礎設施實踐,並釋出 Kubernetes‑EC2 自動擴縮器,以協助研究人員在 AWS 與本地 GPU 叢集上擴展突發工作負載。
OpenAI 機器學習非正式會議 2016 公告
OpenAI 宣布將於 2016 年 10 月 7‑8 日在其舊金山辦公室舉辦免費的機器學習非正式會議,旨在促進參與者驅動的討論與 ML 研究者與從業者之間的交流。
OpenAI 團隊更新 2016 年 8 月:新增全職僱用與實習生
2016 年 8 月 16 日,OpenAI 宣布新增五位全職研究員與工程師以及數名實習生和訪問者,擴展其在語音、安全、策略、GPU 優化、深度學習及相關領域的專業知識。
OpenAI 特別專案 2016
OpenAI 在 2016 年宣布了一份四個優先問題領域的清單,專注於推進 AI 能力和減緩社會風險,包括 AI 偵測、自動編程、網路安全和複雜模擬。
OpenAI 與 Google Brain:AI 安全的具體問題
OpenAI、Google Brain、伯克利與斯坦福的研究人員已確定 AI 安全的五項核心技術挑戰,以確保現代機器學習系統如預期般運作。
OpenAI 技術目標(2016)
OpenAI 在 2016 年概述了其早期技術路線圖,重點在於建立通用智慧指標,並開發能夠執行機器人、自然語言理解與多遊戲精通的代理人。
OpenAI 生成模型研究概覽
OpenAI 闡述生成模型在實現機器對世界理解中的作用,並介紹五項改進 GANs、VAEs 與強化學習的研究專案。
OpenAI 團隊更新 2016年5月
OpenAI 宣布新增數名具備深度學習、競賽程式設計、AI 安全及基礎設施工程專長的全職員工與實習生。
半監督式文本分類的對抗訓練方法
OpenAI 研究人員開發了一種方法,通過在循環神經網路中擾動詞嵌入來應用對抗訓練和虛擬對抗訓練於文本,在半監督式文本分類中達到最先進的結果。
OpenAI Gym Beta 版發布
OpenAI 已發布 OpenAI Gym 的公開 Beta 版,這是一個旨在標準化強化學習環境並加速演算法開發與比較的工具包。
OpenAI 團隊更新:Pieter Abbeel 與 Shivon Zilis 加入
OpenAI 宣布於 2016 年 4 月新增 Pieter Abbeel 為全職團隊成員,並任命 Shivon Zilis 為正式顧問。
OpenAI Team++ 更新
OpenAI 宣布加入數位知名機器學習研究員與實習生,將當前重點放在無監督學習與強化學習上。
權重正規化:加速深度神經網路訓練
OpenAI 研究者提出了權重正規化,一種將權重向量長度與方向解耦的重新參數化技術,以加速隨機梯度下降的收斂,而無需批次正規化的小批量依賴。
介紹 OpenAI:非營利 AI 研究倡議(2015 年 12 月)
2015 年 12 月 11 日,OpenAI 宣布成立,作為一家非營利 AI 研究組織,致力於在不受財務限制的情況下推動數位智慧,以廣泛造福人類。