封存 · 11 個實驗室 · 1,214 篇 dispatch

實驗室

不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。

1101

OpenAI 線上規劃 離線學習 (POLO) 框架

OpenAI 介紹了 Plan Online Learn Offline (POLO) 框架,該框架結合了本地模型式控制與全域價值函數學習,以實現在複雜模擬控制任務中的高效學習。

1102

OpenAI 隨機網路蒸餾 (RND) 用於強化學習

OpenAI 介紹了隨機網路蒸餾 (RND),一種以好奇心驅動的探索方法,首次在《Montezuma's Revenge》中超越平均人類表現,且未使用人類示範或模擬器狀態存取。

1103

OpenAI 迭代放大於複雜目標學習

OpenAI 提出迭代放大,這項 AI 安全技術透過將任務分解為更簡單的子任務以產生訓練訊號,從而使得規範複雜、超出人類規模的目標成為可能。

1104

OpenAI 學者 2019 計畫公告

OpenAI 已開放第二屆 OpenAI 學者計畫的申請,提供獎學金與導師指導給來自弱勢族群的個人,以學習深度學習並開源專案。

1105

OpenAI 2019 冬季研究員與夏季實習生計畫

OpenAI 宣布開放 2019 冬季研究員計畫與 2019 夏季實習生的申請,旨在將來自多元背景的研究者與學生納入其 AI 研究工作。

1106

FFJORD:自由形式連續動力學,用於可擴展的可逆生成模型

OpenAI 介紹了 FFJORD,一種連續時間可逆生成模型,利用 Hutchinson 的追蹤估計器,使得在可擴展的密度估計中能夠使用不受限制的神經網路架構。

1107

OpenAI 學者 2018 最終專案

OpenAI 發布了 2018 年學者計畫的最終專案展示,展示了機器學習在音樂生成、直覺物理和自然語言處理等多元應用。

1108

OpenAI Five:2018 年國際賽結果

OpenAI Five 在 2018 年國際賽中與世界級的職業 Dota 2 玩家競爭,儘管在「真實 Dota」規則下兩場皆告失利,仍展現了高水準的遊戲表現。

1109

OpenAI 大規模好奇心驅動學習研究

OpenAI 研究人員證明,僅以基於預測誤差的內在好奇心獎勵訓練的代理人,能在 54 個基準環境中取得高效能,且不需要任何人工設計的外在獎勵。

1110

OpenAI Five 基準結果

OpenAI Five 在對陣 99.95 百分位 Dota 玩家隊伍的三局兩勝系列賽中獲勝,展示了 AI 在處理複雜性與不確定性方面的先進能力。

1111

OpenAI Dactyl:透過領域隨機化學習靈巧

OpenAI 開發了 Dactyl,一個在模擬環境中訓練類人機械手以高靈巧度操作實體物件的系統,能將所學技能直接轉移至真實世界,且無需微調。

1112

OpenAI 變分選項發現演算法

OpenAI 介紹了透過強化學習的變分自編碼選項學習(VALOR)以及課程式學習方法,以穩定強化學習代理人在多樣行為模式發現上的表現。

1113

OpenAI 學者 2018:認識我們的學者

OpenAI 推出了 2018 年的學者計畫,匯聚了一群多元的研究者,專注於強化學習、語言模型以及 AI 與藝術的交叉領域。

1114

OpenAI Five 基準測試

OpenAI 宣布了一場 OpenAI Five 的基準比賽,擁有擴充的英雄池與更新的遊戲機制,以測試 AI 對抗高百分位的人類玩家。

1115

Glow:更佳的可逆生成模型

OpenAI 推出 Glow,一種使用可逆 1x1 卷積的流式生成模型,能以精確的潛在變數推斷與高效抽樣產生高解析度影像。

1116

從單一示範學習 Montezuma’s Revenge

OpenAI 透過使用單一人類示範來建立逆向起始狀態課程,訓練出一個 RL 代理,使其在 Montezuma’s Revenge 中創下 74,500 的最高分紀錄。

1117

OpenAI Five

OpenAI Five,由五個神經網路組成的團隊,透過在 Dota 2 上的自我對戰進行訓練,開始擊敗業餘人類隊伍,並表明經過擴大的強化學習可以在不需要根本算法進步的情況下處理長時程、部分可觀測的任務。

1118

OpenAI 復古競賽結果

OpenAI 完成了首次復古競賽,最高表現的 Sonic the Hedgehog AI 代理是透過調整或擴展現有演算法(如 PPO 與 Rainbow DQN)開發的。

1119

OpenAI 在多代理系統中的學習政策表徵

OpenAI 介紹了一個將代理建模視為表徵學習問題的通用學習框架,以在多代理系統中使用最少的互動資料來理解代理行為。

1120

OpenAI 透過無監督學習提升語言理解

OpenAI 展示了透過無監督語言模型預訓練,然後在小規模監督資料集上微調的基於 Transformer 的模型,能在包括常識推理在內的多樣語言任務上達到最先進的表現。

1121

GamePad:一個用於定理證明的學習環境

OpenAI 推出 GamePad,一個旨在於 Coq 證明助理中應用機器學習方法於定理證明,以自動化策略預測與位置評估的系統。

1122

OpenAI Fellows 計畫 2018 秋季

OpenAI 於 2018 年秋季推出 Fellows 計畫,為沒有正式 AI 背景的個人提供進入人工智慧研究的途徑。

1123

OpenAI Gym Retro 發佈

OpenAI 已發布 Gym Retro 的完整版本,這是一個強化學習平台,將可用的遊戲庫擴展至超過 1,000 款,涵蓋多個經典主機,以促進對代理泛化的研究。

1124

OpenAI AI 與運算分析

OpenAI 的分析顯示,自 2012 年以來,用於最大規模 AI 訓練的運算量呈指數增長,平均每 3.4 個月翻倍,遠超摩爾定律。

1125

透過辯論的 AI 安全

OpenAI 提出一種安全技術,透過訓練 AI 代理人進行辯論,以協助人類監督執行超出人類認知能力的任務的系統。

1126

OpenAI 演化策略梯度 (EPG)

OpenAI 介紹了演化策略梯度 (EPG),這是一種透過演化損失函數的元學習方法,協助 RL 代理人在同一任務族內泛化到新任務。

1127

OpenAI 必須快速學習基準測試

OpenAI 推出了一個基於《刺猬索尼克》遊戲系列的新強化學習基準,用於衡量遷移學習與少樣本學習的表現。

1128

OpenAI Retro 競賽與 Gym Retro 發布

OpenAI 推出 Retro 競賽,以衡量強化學習在未見過的電子遊戲關卡上的泛化能力,並發布了 Gym Retro,這是一個將 30 款 SEGA Genesis 與 62 款 Atari 2600 遊戲整合至 Gym 的平台。

1129

OpenAI 基於行動依賴分解基線的策略梯度變異降低

OpenAI 研究人員開發了一種無偏差的行動依賴基線,用於策略梯度方法以降低梯度估計的變異,從而在高維度行動空間中實現更快的學習。

1130

OpenAI OT‑GAN:使用最適傳輸改進 GAN

OpenAI 推出最適傳輸 GAN(OT‑GAN),這是一種使用新小批量能量距離度量來提升訓練穩定性與影像生成品質的生成對抗網路變體。

1131

OpenAI 2018年3月黑客松報告

OpenAI 於 2018 年 3 月 3 日舉辦了首次黑客松,匯聚了 100 位 AI 社群成員,開發涵蓋醫療、安全與強化學習的專案。

1132

關於一階元學習演算法

OpenAI 介紹了 Reptile,一種一階元學習演算法,透過優化參數初始化,使代理人在新任務上能快速學習,且不需要二階導數。

1133

OpenAI Reptile:可擴展的元學習演算法

OpenAI 推出 Reptile,一種可擴展的元學習演算法,透過最大化同一任務中不同小批次梯度的內積,使模型能夠從少量範例中進行概括。

1134

OpenAI 學者計畫

OpenAI 推出 OpenAI Scholars 計畫,為來自弱勢族群的個人提供津貼與導師指導,以學習深度學習並開源專案。

1135

OpenAI 研究:透過元強化學習學習探索

OpenAI 研究人員推出了 E-MAML 與 E-RL²,兩種旨在提升複雜環境中探索效能的元強化學習演算法。

1136

OpenAI 機器人研究的材料

OpenAI 發布了八個模擬機器人環境以及 Baselines 實作的 Hindsight Experience Replay (HER),以便在複雜的操作任務中從稀疏獎勵啟用強化學習。

1137

OpenAI 多目標強化學習機器人環境

OpenAI 已發布一套具挑戰性的連續控制機器人任務,已與 OpenAI Gym 整合,以推進多目標強化學習的研究。

1138

OpenAI 黑客松 2018 年 3 月

OpenAI 在 2018 年 3 月 3 日於舊金山舉辦了一場社區黑客松和一系列講座,以鼓勵 AI 學習與專案開發。

1139

OpenAI 支持者與組織更新

OpenAI 宣布新捐贈者、顧問任命,以及伊隆·馬斯克離開其董事會,以避免與特斯拉在人工智慧領域的重點產生潛在衝突。

1140

OpenAI 正為惡意使用 AI 做準備

OpenAI 與其合作夥伴發表了一篇研究論文,預測 AI 可能被惡意行為者濫用的方式,並提供緩解這些全球安全威脅的建議。

1141

OpenAI 透過教學實現可解釋機器學習

OpenAI 提出了一種機器教學方法,該方法使用教師-學生神經網路框架來識別概念的最具說明性範例,確保所得到的解釋是人類可理解的,而不是任意的。

1142

OpenAI 發現用於實體消歧義的類型

OpenAI 開發了一個系統,使用神經網路來預測自動發現的類型的成員資格,以提高 CoNLL 和 TAC KBP 2010 資料集上的實體消歧義準確度。

1143

OpenAI 研究請求 2.0

OpenAI 發布了 Research Requests 2.0,這是一系列七個未解決的強化學習與機器學習技術問題,旨在鼓勵社群貢獻。

1144

將 Kubernetes 擴展至 2,500 個節點

OpenAI 描述了為了在 Azure 上進行深度學習研究,將 Kubernetes 集群擴展至 2,500 個節點所需的技術優化,解決了 etcd、網路和鏡像拉取方面的瓶頸。

1145

OpenAI 區塊稀疏 GPU 核心

OpenAI 已發布高度優化的 GPU 核心,適用於區塊稀疏神經網路架構,使模型能夠變得更寬更深,同時運行速度比 cuBLAS 或 cuSPARSE 快上幾個數量級。

1146

OpenAI 透過 L0 正則化學習稀疏神經網路

OpenAI 介紹了一種在神經網路中使用 L0 範數正則化的方法,透過隨機門將權重精確設為零,以建立稀疏模型,提升訓練速度、推論速度與泛化能力。

1147

OpenAI 可解釋且教學範例研究

OpenAI 研究人員表明,以迭代方式而非聯合方式訓練教師和學生神經網路,能產出可解釋的教學策略,該策略能有效地同時教導 AI 和人類。

1148

OpenAI 學習階層研究

OpenAI 已開發 Meta-Learning Shared Hierarchies (MLSH),一種強化學習演算法,能自動發現高層次動作,以比暴力方法更高效的方式解決複雜的長時域任務。

1149

OpenAI 從模擬中泛化

OpenAI 使用動態和域隨機化技術,在模擬中訓練機器人控制器,使其能夠泛化到實體機器人並對未規劃的環境變化做出反應。

1150

OpenAI 透過動態隨機化實現機械手臂控制的 Sim-to-Real 轉移

OpenAI 研究人員開發了一種動態隨機化方法,使得僅在模擬中訓練的機械手臂控制策略能夠直接轉移到真實硬體,而無需額外的實體訓練。