✷ 封存 · 11 個實驗室 · 1,214 篇 dispatch
實驗室
不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。
OpenAI 線上規劃 離線學習 (POLO) 框架
OpenAI 介紹了 Plan Online Learn Offline (POLO) 框架,該框架結合了本地模型式控制與全域價值函數學習,以實現在複雜模擬控制任務中的高效學習。
OpenAI 隨機網路蒸餾 (RND) 用於強化學習
OpenAI 介紹了隨機網路蒸餾 (RND),一種以好奇心驅動的探索方法,首次在《Montezuma's Revenge》中超越平均人類表現,且未使用人類示範或模擬器狀態存取。
OpenAI 迭代放大於複雜目標學習
OpenAI 提出迭代放大,這項 AI 安全技術透過將任務分解為更簡單的子任務以產生訓練訊號,從而使得規範複雜、超出人類規模的目標成為可能。
OpenAI 學者 2019 計畫公告
OpenAI 已開放第二屆 OpenAI 學者計畫的申請,提供獎學金與導師指導給來自弱勢族群的個人,以學習深度學習並開源專案。
OpenAI 2019 冬季研究員與夏季實習生計畫
OpenAI 宣布開放 2019 冬季研究員計畫與 2019 夏季實習生的申請,旨在將來自多元背景的研究者與學生納入其 AI 研究工作。
FFJORD:自由形式連續動力學,用於可擴展的可逆生成模型
OpenAI 介紹了 FFJORD,一種連續時間可逆生成模型,利用 Hutchinson 的追蹤估計器,使得在可擴展的密度估計中能夠使用不受限制的神經網路架構。
OpenAI 學者 2018 最終專案
OpenAI 發布了 2018 年學者計畫的最終專案展示,展示了機器學習在音樂生成、直覺物理和自然語言處理等多元應用。
OpenAI Five:2018 年國際賽結果
OpenAI Five 在 2018 年國際賽中與世界級的職業 Dota 2 玩家競爭,儘管在「真實 Dota」規則下兩場皆告失利,仍展現了高水準的遊戲表現。
OpenAI 大規模好奇心驅動學習研究
OpenAI 研究人員證明,僅以基於預測誤差的內在好奇心獎勵訓練的代理人,能在 54 個基準環境中取得高效能,且不需要任何人工設計的外在獎勵。
OpenAI Five 基準結果
OpenAI Five 在對陣 99.95 百分位 Dota 玩家隊伍的三局兩勝系列賽中獲勝,展示了 AI 在處理複雜性與不確定性方面的先進能力。
OpenAI Dactyl:透過領域隨機化學習靈巧
OpenAI 開發了 Dactyl,一個在模擬環境中訓練類人機械手以高靈巧度操作實體物件的系統,能將所學技能直接轉移至真實世界,且無需微調。
OpenAI 變分選項發現演算法
OpenAI 介紹了透過強化學習的變分自編碼選項學習(VALOR)以及課程式學習方法,以穩定強化學習代理人在多樣行為模式發現上的表現。
OpenAI 學者 2018:認識我們的學者
OpenAI 推出了 2018 年的學者計畫,匯聚了一群多元的研究者,專注於強化學習、語言模型以及 AI 與藝術的交叉領域。
OpenAI Five 基準測試
OpenAI 宣布了一場 OpenAI Five 的基準比賽,擁有擴充的英雄池與更新的遊戲機制,以測試 AI 對抗高百分位的人類玩家。
Glow:更佳的可逆生成模型
OpenAI 推出 Glow,一種使用可逆 1x1 卷積的流式生成模型,能以精確的潛在變數推斷與高效抽樣產生高解析度影像。
從單一示範學習 Montezuma’s Revenge
OpenAI 透過使用單一人類示範來建立逆向起始狀態課程,訓練出一個 RL 代理,使其在 Montezuma’s Revenge 中創下 74,500 的最高分紀錄。
OpenAI Five
OpenAI Five,由五個神經網路組成的團隊,透過在 Dota 2 上的自我對戰進行訓練,開始擊敗業餘人類隊伍,並表明經過擴大的強化學習可以在不需要根本算法進步的情況下處理長時程、部分可觀測的任務。
OpenAI 復古競賽結果
OpenAI 完成了首次復古競賽,最高表現的 Sonic the Hedgehog AI 代理是透過調整或擴展現有演算法(如 PPO 與 Rainbow DQN)開發的。
OpenAI 在多代理系統中的學習政策表徵
OpenAI 介紹了一個將代理建模視為表徵學習問題的通用學習框架,以在多代理系統中使用最少的互動資料來理解代理行為。
OpenAI 透過無監督學習提升語言理解
OpenAI 展示了透過無監督語言模型預訓練,然後在小規模監督資料集上微調的基於 Transformer 的模型,能在包括常識推理在內的多樣語言任務上達到最先進的表現。
GamePad:一個用於定理證明的學習環境
OpenAI 推出 GamePad,一個旨在於 Coq 證明助理中應用機器學習方法於定理證明,以自動化策略預測與位置評估的系統。
OpenAI Fellows 計畫 2018 秋季
OpenAI 於 2018 年秋季推出 Fellows 計畫,為沒有正式 AI 背景的個人提供進入人工智慧研究的途徑。
OpenAI Gym Retro 發佈
OpenAI 已發布 Gym Retro 的完整版本,這是一個強化學習平台,將可用的遊戲庫擴展至超過 1,000 款,涵蓋多個經典主機,以促進對代理泛化的研究。
OpenAI AI 與運算分析
OpenAI 的分析顯示,自 2012 年以來,用於最大規模 AI 訓練的運算量呈指數增長,平均每 3.4 個月翻倍,遠超摩爾定律。
透過辯論的 AI 安全
OpenAI 提出一種安全技術,透過訓練 AI 代理人進行辯論,以協助人類監督執行超出人類認知能力的任務的系統。
OpenAI 演化策略梯度 (EPG)
OpenAI 介紹了演化策略梯度 (EPG),這是一種透過演化損失函數的元學習方法,協助 RL 代理人在同一任務族內泛化到新任務。
OpenAI 必須快速學習基準測試
OpenAI 推出了一個基於《刺猬索尼克》遊戲系列的新強化學習基準,用於衡量遷移學習與少樣本學習的表現。
OpenAI Retro 競賽與 Gym Retro 發布
OpenAI 推出 Retro 競賽,以衡量強化學習在未見過的電子遊戲關卡上的泛化能力,並發布了 Gym Retro,這是一個將 30 款 SEGA Genesis 與 62 款 Atari 2600 遊戲整合至 Gym 的平台。
OpenAI 基於行動依賴分解基線的策略梯度變異降低
OpenAI 研究人員開發了一種無偏差的行動依賴基線,用於策略梯度方法以降低梯度估計的變異,從而在高維度行動空間中實現更快的學習。
OpenAI OT‑GAN:使用最適傳輸改進 GAN
OpenAI 推出最適傳輸 GAN(OT‑GAN),這是一種使用新小批量能量距離度量來提升訓練穩定性與影像生成品質的生成對抗網路變體。
OpenAI 2018年3月黑客松報告
OpenAI 於 2018 年 3 月 3 日舉辦了首次黑客松,匯聚了 100 位 AI 社群成員,開發涵蓋醫療、安全與強化學習的專案。
關於一階元學習演算法
OpenAI 介紹了 Reptile,一種一階元學習演算法,透過優化參數初始化,使代理人在新任務上能快速學習,且不需要二階導數。
OpenAI Reptile:可擴展的元學習演算法
OpenAI 推出 Reptile,一種可擴展的元學習演算法,透過最大化同一任務中不同小批次梯度的內積,使模型能夠從少量範例中進行概括。
OpenAI 學者計畫
OpenAI 推出 OpenAI Scholars 計畫,為來自弱勢族群的個人提供津貼與導師指導,以學習深度學習並開源專案。
OpenAI 研究:透過元強化學習學習探索
OpenAI 研究人員推出了 E-MAML 與 E-RL²,兩種旨在提升複雜環境中探索效能的元強化學習演算法。
OpenAI 機器人研究的材料
OpenAI 發布了八個模擬機器人環境以及 Baselines 實作的 Hindsight Experience Replay (HER),以便在複雜的操作任務中從稀疏獎勵啟用強化學習。
OpenAI 多目標強化學習機器人環境
OpenAI 已發布一套具挑戰性的連續控制機器人任務,已與 OpenAI Gym 整合,以推進多目標強化學習的研究。
OpenAI 黑客松 2018 年 3 月
OpenAI 在 2018 年 3 月 3 日於舊金山舉辦了一場社區黑客松和一系列講座,以鼓勵 AI 學習與專案開發。
OpenAI 支持者與組織更新
OpenAI 宣布新捐贈者、顧問任命,以及伊隆·馬斯克離開其董事會,以避免與特斯拉在人工智慧領域的重點產生潛在衝突。
OpenAI 正為惡意使用 AI 做準備
OpenAI 與其合作夥伴發表了一篇研究論文,預測 AI 可能被惡意行為者濫用的方式,並提供緩解這些全球安全威脅的建議。
OpenAI 透過教學實現可解釋機器學習
OpenAI 提出了一種機器教學方法,該方法使用教師-學生神經網路框架來識別概念的最具說明性範例,確保所得到的解釋是人類可理解的,而不是任意的。
OpenAI 發現用於實體消歧義的類型
OpenAI 開發了一個系統,使用神經網路來預測自動發現的類型的成員資格,以提高 CoNLL 和 TAC KBP 2010 資料集上的實體消歧義準確度。
OpenAI 研究請求 2.0
OpenAI 發布了 Research Requests 2.0,這是一系列七個未解決的強化學習與機器學習技術問題,旨在鼓勵社群貢獻。
將 Kubernetes 擴展至 2,500 個節點
OpenAI 描述了為了在 Azure 上進行深度學習研究,將 Kubernetes 集群擴展至 2,500 個節點所需的技術優化,解決了 etcd、網路和鏡像拉取方面的瓶頸。
OpenAI 區塊稀疏 GPU 核心
OpenAI 已發布高度優化的 GPU 核心,適用於區塊稀疏神經網路架構,使模型能夠變得更寬更深,同時運行速度比 cuBLAS 或 cuSPARSE 快上幾個數量級。
OpenAI 透過 L0 正則化學習稀疏神經網路
OpenAI 介紹了一種在神經網路中使用 L0 範數正則化的方法,透過隨機門將權重精確設為零,以建立稀疏模型,提升訓練速度、推論速度與泛化能力。
OpenAI 可解釋且教學範例研究
OpenAI 研究人員表明,以迭代方式而非聯合方式訓練教師和學生神經網路,能產出可解釋的教學策略,該策略能有效地同時教導 AI 和人類。
OpenAI 學習階層研究
OpenAI 已開發 Meta-Learning Shared Hierarchies (MLSH),一種強化學習演算法,能自動發現高層次動作,以比暴力方法更高效的方式解決複雜的長時域任務。
OpenAI 從模擬中泛化
OpenAI 使用動態和域隨機化技術,在模擬中訓練機器人控制器,使其能夠泛化到實體機器人並對未規劃的環境變化做出反應。
OpenAI 透過動態隨機化實現機械手臂控制的 Sim-to-Real 轉移
OpenAI 研究人員開發了一種動態隨機化方法,使得僅在模擬中訓練的機械手臂控制策略能夠直接轉移到真實硬體,而無需額外的實體訓練。