7551

OpenAI Spinning Up in Deep RL Workshop Review

OpenAI 主辦了一場基於其 Spinning Up in Deep RL 資源包的研討會,旨在為多樣化的參與者群體擴展強化學習的指導與技能開發。

7552

AI Safety Needs Social Scientists

OpenAI 主張,長期的 AI 安全與對齊需要整合社會科學,以考量人類的認知偏見與人類價值觀的複雜性。

7553

OpenAI GPT-2 發布與影響

OpenAI 推出了 GPT-2,一個擁有 15 億參數的無監督語言模型,具備零樣本任務執行能力與連貫文本生成,同時採取分階段發布策略以降低濫用風險。

7554

OpenAI 研究:強健分類中的計算限制

OpenAI 研究人員已識別出某些分類任務,在這些任務中強健分類器存在但計算上無法學習,從而將強健學習的難度與密碼學原語的存在聯繫起來。

7555

OpenAI Summer Fellows 2018 Final Projects

OpenAI 的 2018 Summer Fellows 完成了專注於強化學習泛化能力、分散式訓練模式以及生成模型表達能力的研究專案。

7556

AI 訓練規模化:透過梯度噪聲尺度預測平行化能力

OpenAI 發現,梯度噪聲尺度作為衡量網路梯度訊噪比的統計指標,能夠預測在各種任務中神經網路訓練的最大有效批次大小。

7557

量化強化學習中的泛化能力

OpenAI 推出 CoinRun,一個程序生成的訓練環境,旨在量化並提升代理在強化學習中將已學技能轉移至新情境的能力。

7558

OpenAI 深度強化學習入門指南

OpenAI 已發布 Spinning Up in Deep RL,這是一個提供程式碼、教學與文件的教育資源,協助實踐者精通深度強化學習。

7559

OpenAI 使用能量函數學習概念

OpenAI 開發了一種利用能量函數的技術,使代理能夠學習與提取概念,且這些概念可在不同環境間轉移,無需重新訓練。

7560

OpenAI 線上規劃 離線學習 (POLO) 框架

OpenAI 介紹了 Plan Online Learn Offline (POLO) 框架,該框架結合了本地模型式控制與全域價值函數學習,以實現在複雜模擬控制任務中的高效學習。

7561

OpenAI 隨機網路蒸餾 (RND) 用於強化學習

OpenAI 介紹了隨機網路蒸餾 (RND),一種以好奇心驅動的探索方法,首次在《Montezuma's Revenge》中超越平均人類表現,且未使用人類示範或模擬器狀態存取。

7562

OpenAI 迭代放大於複雜目標學習

OpenAI 提出迭代放大,這項 AI 安全技術透過將任務分解為更簡單的子任務以產生訓練訊號,從而使得規範複雜、超出人類規模的目標成為可能。

7563

OpenAI 學者 2019 計畫公告

OpenAI 已開放第二屆 OpenAI 學者計畫的申請,提供獎學金與導師指導給來自弱勢族群的個人,以學習深度學習並開源專案。

7564

OpenAI 2019 冬季研究員與夏季實習生計畫

OpenAI 宣布開放 2019 冬季研究員計畫與 2019 夏季實習生的申請,旨在將來自多元背景的研究者與學生納入其 AI 研究工作。

7565

FFJORD:自由形式連續動力學,用於可擴展的可逆生成模型

OpenAI 介紹了 FFJORD,一種連續時間可逆生成模型,利用 Hutchinson 的追蹤估計器,使得在可擴展的密度估計中能夠使用不受限制的神經網路架構。

7566

OpenAI 學者 2018 最終專案

OpenAI 發布了 2018 年學者計畫的最終專案展示,展示了機器學習在音樂生成、直覺物理和自然語言處理等多元應用。

7567

OpenAI Five:2018 年國際賽結果

OpenAI Five 在 2018 年國際賽中與世界級的職業 Dota 2 玩家競爭,儘管在「真實 Dota」規則下兩場皆告失利,仍展現了高水準的遊戲表現。

7568

OpenAI 大規模好奇心驅動學習研究

OpenAI 研究人員證明,僅以基於預測誤差的內在好奇心獎勵訓練的代理人,能在 54 個基準環境中取得高效能,且不需要任何人工設計的外在獎勵。

7569

OpenAI Five 基準結果

OpenAI Five 在對陣 99.95 百分位 Dota 玩家隊伍的三局兩勝系列賽中獲勝,展示了 AI 在處理複雜性與不確定性方面的先進能力。

7570

OpenAI Dactyl:透過領域隨機化學習靈巧

OpenAI 開發了 Dactyl,一個在模擬環境中訓練類人機械手以高靈巧度操作實體物件的系統,能將所學技能直接轉移至真實世界,且無需微調。

7571

OpenAI 變分選項發現演算法

OpenAI 介紹了透過強化學習的變分自編碼選項學習(VALOR)以及課程式學習方法,以穩定強化學習代理人在多樣行為模式發現上的表現。

7572

OpenAI 學者 2018:認識我們的學者

OpenAI 推出了 2018 年的學者計畫,匯聚了一群多元的研究者,專注於強化學習、語言模型以及 AI 與藝術的交叉領域。

7573

OpenAI Five 基準測試

OpenAI 宣布了一場 OpenAI Five 的基準比賽,擁有擴充的英雄池與更新的遊戲機制,以測試 AI 對抗高百分位的人類玩家。

7574

Glow:更佳的可逆生成模型

OpenAI 推出 Glow,一種使用可逆 1x1 卷積的流式生成模型,能以精確的潛在變數推斷與高效抽樣產生高解析度影像。

7575

從單一示範學習 Montezuma’s Revenge

OpenAI 透過使用單一人類示範來建立逆向起始狀態課程,訓練出一個 RL 代理,使其在 Montezuma’s Revenge 中創下 74,500 的最高分紀錄。

7576

OpenAI Five

OpenAI Five,由五個神經網路組成的團隊,透過在 Dota 2 上的自我對戰進行訓練,開始擊敗業餘人類隊伍,並表明經過擴大的強化學習可以在不需要根本算法進步的情況下處理長時程、部分可觀測的任務。

7577

OpenAI 復古競賽結果

OpenAI 完成了首次復古競賽,最高表現的 Sonic the Hedgehog AI 代理是透過調整或擴展現有演算法(如 PPO 與 Rainbow DQN)開發的。

7578

OpenAI 在多代理系統中的學習政策表徵

OpenAI 介紹了一個將代理建模視為表徵學習問題的通用學習框架,以在多代理系統中使用最少的互動資料來理解代理行為。

7579

OpenAI 透過無監督學習提升語言理解

OpenAI 展示了透過無監督語言模型預訓練,然後在小規模監督資料集上微調的基於 Transformer 的模型,能在包括常識推理在內的多樣語言任務上達到最先進的表現。

7580

GamePad:一個用於定理證明的學習環境

OpenAI 推出 GamePad,一個旨在於 Coq 證明助理中應用機器學習方法於定理證明,以自動化策略預測與位置評估的系統。

7581

OpenAI Fellows 計畫 2018 秋季

OpenAI 於 2018 年秋季推出 Fellows 計畫,為沒有正式 AI 背景的個人提供進入人工智慧研究的途徑。

7582

OpenAI Gym Retro 發佈

OpenAI 已發布 Gym Retro 的完整版本,這是一個強化學習平台,將可用的遊戲庫擴展至超過 1,000 款,涵蓋多個經典主機,以促進對代理泛化的研究。

7583

OpenAI AI 與運算分析

OpenAI 的分析顯示,自 2012 年以來,用於最大規模 AI 訓練的運算量呈指數增長,平均每 3.4 個月翻倍,遠超摩爾定律。

7584

透過辯論的 AI 安全

OpenAI 提出一種安全技術,透過訓練 AI 代理人進行辯論,以協助人類監督執行超出人類認知能力的任務的系統。

7585

OpenAI 演化策略梯度 (EPG)

OpenAI 介紹了演化策略梯度 (EPG),這是一種透過演化損失函數的元學習方法,協助 RL 代理人在同一任務族內泛化到新任務。

7586

OpenAI 必須快速學習基準測試

OpenAI 推出了一個基於《刺猬索尼克》遊戲系列的新強化學習基準,用於衡量遷移學習與少樣本學習的表現。

7587

OpenAI Retro 競賽與 Gym Retro 發布

OpenAI 推出 Retro 競賽,以衡量強化學習在未見過的電子遊戲關卡上的泛化能力,並發布了 Gym Retro,這是一個將 30 款 SEGA Genesis 與 62 款 Atari 2600 遊戲整合至 Gym 的平台。

7588

OpenAI 基於行動依賴分解基線的策略梯度變異降低

OpenAI 研究人員開發了一種無偏差的行動依賴基線,用於策略梯度方法以降低梯度估計的變異,從而在高維度行動空間中實現更快的學習。

7589

OpenAI OT‑GAN:使用最適傳輸改進 GAN

OpenAI 推出最適傳輸 GAN(OT‑GAN),這是一種使用新小批量能量距離度量來提升訓練穩定性與影像生成品質的生成對抗網路變體。

7590

OpenAI 2018年3月黑客松報告

OpenAI 於 2018 年 3 月 3 日舉辦了首次黑客松,匯聚了 100 位 AI 社群成員,開發涵蓋醫療、安全與強化學習的專案。

7591

關於一階元學習演算法

OpenAI 介紹了 Reptile,一種一階元學習演算法,透過優化參數初始化,使代理人在新任務上能快速學習,且不需要二階導數。

7592

OpenAI Reptile:可擴展的元學習演算法

OpenAI 推出 Reptile,一種可擴展的元學習演算法,透過最大化同一任務中不同小批次梯度的內積,使模型能夠從少量範例中進行概括。

7593

OpenAI 學者計畫

OpenAI 推出 OpenAI Scholars 計畫,為來自弱勢族群的個人提供津貼與導師指導,以學習深度學習並開源專案。

7594

OpenAI 研究:透過元強化學習學習探索

OpenAI 研究人員推出了 E-MAML 與 E-RL²,兩種旨在提升複雜環境中探索效能的元強化學習演算法。

7595

OpenAI 機器人研究的材料

OpenAI 發布了八個模擬機器人環境以及 Baselines 實作的 Hindsight Experience Replay (HER),以便在複雜的操作任務中從稀疏獎勵啟用強化學習。

7596

OpenAI 多目標強化學習機器人環境

OpenAI 已發布一套具挑戰性的連續控制機器人任務,已與 OpenAI Gym 整合,以推進多目標強化學習的研究。

7597

OpenAI 黑客松 2018 年 3 月

OpenAI 在 2018 年 3 月 3 日於舊金山舉辦了一場社區黑客松和一系列講座,以鼓勵 AI 學習與專案開發。

7598

OpenAI 支持者與組織更新

OpenAI 宣布新捐贈者、顧問任命,以及伊隆·馬斯克離開其董事會,以避免與特斯拉在人工智慧領域的重點產生潛在衝突。

7599

OpenAI 正為惡意使用 AI 做準備

OpenAI 與其合作夥伴發表了一篇研究論文,預測 AI 可能被惡意行為者濫用的方式,並提供緩解這些全球安全威脅的建議。

7600

OpenAI 透過教學實現可解釋機器學習

OpenAI 提出了一種機器教學方法,該方法使用教師-學生神經網路框架來識別概念的最具說明性範例,確保所得到的解釋是人類可理解的,而不是任意的。