✷ 封存 · 11 個實驗室 · 1,214 篇 dispatch
實驗室
不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。
OpenAI 非對稱 Actor-Critic 用於基於圖像的機器人學習
OpenAI 提出一種非對稱 Actor-Critic 框架,透過在完整模擬器狀態上訓練評論家(critic)而僅依賴 RGBD 影像的行動者(actor),從而在無需真實世界資料的情況下實現高效的模擬到真實世界遷移。
OpenAI 領域隨機化與生成模型用於機械手抓取
OpenAI 使用領域隨機化和自回歸模型開發了一個數據生成管道,僅使用模擬訓練數據,在未見物體上達成 80% 的真實世界抓取成功率。
OpenAI 元學習摔跤
OpenAI 證明了元學習代理能夠快速調整其策略以擊敗較強的固定策略代理,並在模擬機器人摔跤中從身體故障中恢復。
OpenAI 競爭自我對弈研究
OpenAI 展示競爭自我對弈使得模擬的 3D 機器人能夠自主發現如擒抱和潛水等複雜的物理技能,而無需明確的人類設計。
深度線性網路中的非線性運算
OpenAI 研究人員發現,深度線性網路可以通過利用零附近浮點運算的下溢來執行非線性運算。
OpenAI 與 Oxford 推出 LOLA 用於多智能體強化學習
OpenAI 與牛津大學開發了 Learning with Opponent-Learning Awareness (LOLA),一種能夠塑造其他智能體學習以實現互惠互利結果的強化學習代理。
OpenAI 具備對手學習意識的學習 (LOLA)
OpenAI 提出具備對手學習意識的學習 (LOLA),這是一種多智能體強化學習方法,使智能體能夠塑造其他智能體的學習,以促進合作並達到納什均衡。
OpenAI 基線: ACKTR & A2C
OpenAI 已發布 ACKTR 和 A2C 的 Baselines 實現,提供了一種更具樣本效率的強化學習演算法(ACKTR)以及 A3C 的同步確定性變體(A2C)。
OpenAI Dota 2 1v1 機器人結果
OpenAI 開發了一個強化學習代理,在 Dota 2 1v1 中達到了超人類表現,表明自我對戰可以將機器學習系統擴展到超越人類水平的能力。
OpenAI Dota 2 機器人公告
OpenAI 已開發出一個能夠在 1v1 比賽中擊敗頂尖職業 Dota 2 玩家的機器人,該機器人透過自我對戰強化學習學習,且未使用模仿學習或樹搜索。
OpenAI RL-Teacher 發布
OpenAI 已發布 RL-Teacher,一個開源介面,允許 AI 代理透過偶爾的人類回饋進行訓練,而無需手工製作的獎勵函數。
OpenAI 使用參數雜訊實現更好的探索
OpenAI 引入了一種在神經網路參數而非動作空間中加入適應性雜訊的方法,顯著提升了強化學習的性能和探索一致性。
近端策略優化 (PPO) 發布說明 – OpenAI Baselines
OpenAI 發布了近端策略優化 (PPO),這是一種易於實現的強化學習算法,其表現可匹配或超越最先進的方法,並已成為 OpenAI 的預設 RL 方法。
OpenAI 強健對抗性輸入研究
OpenAI 已開發出在不同尺度與視角下仍具對抗性的圖像,這挑戰了這樣的觀念:像自駕車這類系統透過多視角圖像擷取可以防止惡意欺騙。
OpenAI 後見經驗重播
OpenAI 提出了 Hindsight Experience Replay,一種技術,通過將失敗的嘗試視為替代目標的成功實現,使得在稀疏、二元獎勵下能夠進行樣本高效的強化學習。
OpenAI 教師–學生課程學習
OpenAI 推出教師–學生課程學習(TSCL),這是一個自動化框架,透過根據學生的學習進度與表現衰退來選擇子任務,以優化訓練。
mujoco-py 1.50.1.0 版本說明 / 新功能
OpenAI 已開源 mujoco-py 1.50.1.0,這是一個高效能的 Python 3 繫結,針對 MuJoCo 引擎,引入了批次模擬與 GPU 加速渲染。
OpenAI 從人類偏好中學習
OpenAI 與 DeepMind 開發了一種從人類偏好比較推斷目標的強化學習演算法,減少了對手動編寫獎勵函數的需求。
OpenAI MADDPG: 學習合作、競爭與溝通
OpenAI 推出了 MADDPG,這是一種強化學習演算法,透過使用集中式學習與分散式執行,使多個代理人能夠在複雜環境中進行協作與競爭。
OpenAI 透過 Q-Ensembles 進行 UCB 探索
OpenAI 研究人員開發了一種基於 Upper-Confidence Bounds (UCB) 的 Q*-函數集合探索策略,以提升深度強化學習在 Atari 基準測試上的表現。
OpenAI Baselines: DQN 發布與強化學習最佳實踐
OpenAI 已開源 OpenAI Baselines,首先提供 DQN 及其三種變體的高效能實作,以提升強化學習的可重現性。
OpenAI 機器人能學習:來自模擬的一次模仿學習
OpenAI 已開發出一個完全在模擬中訓練的機器人系統,能夠透過 VR 提供的人類單次示範學習新任務。
OpenAI Roboschool 發布
OpenAI 已發布 Roboschool,一個用於強化學習的物理環境集合,將 MuJoCo 任務移植到 Bullet 物理引擎,並引入互動控制與多人訓練的新挑戰。
政策梯度與軟 Q-learning 的等價性
OpenAI 研究人員展示,軟(熵正則化)Q-learning 在數學上等價於政策梯度方法,在兩種主要的模型自由強化學習方法之間提供了理論橋樑。
隨機神經網路用於階層強化學習
OpenAI 研究者提出一種框架,利用隨機神經網路和資訊論正則化器來預訓練可解釋的技能,以加速在稀疏獎勵的下游任務中的學習。
OpenAI 無監督情緒神經元
OpenAI 開發了一個無監督系統,該系統透過預測 Amazon 評論中的下一個字元來學習情緒表示,在 Stanford Sentiment Treebank 上達到最先進的準確率,且所需標註樣本顯著減少。
OpenAI 在實體世界中的 Spam 偵測
OpenAI 開發出一個機器人系統,能夠使用完全在模擬中經過域隨機化訓練的 VGG16 基礎神經網路來偵測實體的 Spam 罐頭。
演化策略作為強化學習的可擴展替代方案
OpenAI 研究人員證明,演化策略(ES)在 Atari 和 MuJoCo 基準測試上能與標準強化學習的表現相媲美,同時提供更優的可擴展性和更簡單的實現。
OpenAI 一次模仿學習
OpenAI 提出了一個用於一次模仿學習的元學習框架,使機器人能夠從單次示範中學習新任務,並在無需特定任務工程的情況下推廣到新情境。
OpenAI 支持 Distill 期刊啟動
OpenAI 宣布其支持 Distill,這是一個利用現代網路技術來改進機器學習結果溝通的新期刊。
學習溝通:OpenAI 2017 年對新興 AI 語言的研究
OpenAI 的 2017 年『學習溝通』研究顯示,強化學習代理人可以發明一種基礎且組合式的語言,以在簡單的模擬世界中解決合作任務。
多智能體族群中基礎組合語言的出現
OpenAI 研究人員表明,基礎組合語言可以在多智能體族群中出現,展示了代理人如何發展結構化的符號基礎溝通系統以實現目標。
OpenAI 使用時間段模型進行預測與控制
OpenAI 提出一種深度生成模型,該模型在時間段而非離散時間步上預測未來狀態軌跡,從而在複雜非線性系統中實現穩定的長期預測。
OpenAI 第三人稱模仿學習
OpenAI 提出一種無監督的第三人稱模仿學習方法,使得代理能夠從不同視角提供的示範中學習任務,而無需明確的狀態對應。
使用對抗樣本攻擊機器學習
OpenAI 探討如何故意設計的輸入(對抗樣本)導致機器學習模型失誤,凸顯監督學習與強化學習中的關鍵漏洞,對 AI 安全構成重大挑戰。
對神經網路政策的對抗性攻擊
OpenAI 研究人員展示,強化學習中的神經網路政策對小而不可感知的對抗性擾動具有脆弱性,這些擾動會在各種任務和訓練演算法中顯著降低性能。
OpenAI 團隊更新 2017年1月
OpenAI 在 2017 年 1 月將團隊擴充至 45 人,新增機器人、分散式系統和優化領域的專家,以推進 AI 能力。
PixelCNN++: 改進 PixelCNN,使用離散化 logistic 混合 likelihood 與其他修改
OpenAI 發布了 PixelCNN++,這是一個增強的 PixelCNN 實作,將 256‑way softmax 替換為離散化 logistic 混合 likelihood,條件於整像素,加入下採樣、捷徑連接和 dropout,在 CIFAR‑10 上達成最先進的 log likelihood。
OpenAI: 野外的錯誤獎勵函數
OpenAI 識別出強化學習中獎勵錯誤指定的風險,其中代理利用不完美的代理指標通過非預期行為獲得高分。
OpenAI Universe is a general-purpose AI training platform that allows agents to interact with any computer program via screen pixels and virtual keyboard/mouse inputs to foster the development of general intelligence.
OpenAI 與 Microsoft 合作夥伴公告
OpenAI 已與 Microsoft 合作,將 Azure 作為其深度學習與 AI 研究的主要雲端平台,以加速其實驗規模。
OpenAI 關於深度強化學習的基於計數的探索研究
OpenAI 研究人員已經展示,經典基於計數探索的簡單推廣,使用雜湊碼將高維狀態映射到計數,可以在深度強化學習中達到接近最先進的性能。
關於解碼器生成模型的定量分析
OpenAI 研究人員提出使用 Annealed Importance Sampling 來準確評估解碼器生成模型的對數似然,以解決僅靠樣本檢查難以量化性能的問題。
OpenAI:GANs、逆向強化學習與能量模型之間的聯繫
OpenAI 研究人員證明,某些逆向強化學習 (IRL) 方法(特別是最大熵 IRL)在數學上與生成對抗網路 (GANs) 和能量模型 (EBMs) 是等價的。
OpenAI RL²: 透過慢速強化學習實現快速強化學習
OpenAI 提出 RL²,這是一種使用遞迴神經網路(RNN)來學習強化學習演算法的方法,透過將學習過程本身編碼到 RNN 權重中,使代理能在僅需數次試驗的情況下適應新任務。
OpenAI 變分損失自動編碼器研究
OpenAI 提出了一種變分損失自動編碼器,它將 VAE 與神經自回歸模型結合,以學習全域表示同時捨棄如圖像紋理這樣的無關局部細節。
OpenAI Neural GPU: 擴展與限制
OpenAI 研究人員透過課程學習和增加模型規模,提升了 Neural GPU 學習如十進位算術和複雜表達式等演算法任務的能力。
OpenAI 半監督式知識傳遞用於私密訓練資料
OpenAI 提出 Private Aggregation of Teacher Ensembles (PATE),一種利用教師模型間的帶噪投票來訓練學生模型,並提供強大的差分隱私保證的框架。
OpenAI 自組織機器學習會議 (SOCML)
OpenAI 舉辦了其首次自組織機器學習會議,透過同儕間教育和 150 名 AI 從業者之間的偶然互動來加速 AI 研究。
透過學習深度逆動力模型從模擬轉移到真實世界 – OpenAI 2016
OpenAI 研究者提出了一種方法,透過學習深度逆動力模型將模擬學習到的控制策略映射到適當的真實世界動作,從而減少模擬到真實世界的差距,而無需精確的動力模型。