2101

OpenAI Retro 竞赛与 Gym Retro 发布

OpenAI 发起了 Retro 竞赛,以衡量强化学习在未见视频游戏关卡上的泛化能力,并发布了 Gym Retro——一个将 30 款 SEGA Genesis 和 62 款 Atari 2600 游戏集成到 Gym 中的平台。

2102

OpenAI 基于动作依赖因子化基线的策略梯度方差降低

OpenAI 的研究人员开发了一种无偏的动作依赖基线用于策略梯度方法,以降低梯度估计的方差,从而在高维动作空间中实现更快的学习。

2103

OpenAI OT-GAN:使用最优传输改进 GAN

OpenAI 推出最优传输 GAN(OT-GAN),这是一种使用新型小批量能量距离度量来提升训练稳定性和图像生成质量的生成对抗网络变体。

2104

OpenAI 2018年3月黑客马拉松报告

OpenAI 于 2018 年 3 月 3 日举办了首次黑客马拉松,汇聚了 100 名 AI 社区成员,开发涵盖医疗、安全和强化学习的项目。

2105

关于一阶元学习算法

OpenAI 介绍了 Reptile,这是一种一阶元学习算法,通过优化参数初始化,使代理能够在新任务上快速学习,而无需二阶导数。

2106

OpenAI Reptile:可扩展的元学习算法

OpenAI 推出了 Reptile,这是一种可扩展的元学习算法,通过最大化同一任务不同小批量梯度之间的内积,使模型能够从少量示例中实现泛化。

2107

OpenAI 学者计划

OpenAI 推出了 OpenAI 学者计划,为弱势群体的个人提供补助金和导师指导,以学习深度学习并开源项目。

2108

OpenAI 研究:通过元强化学习学习探索

OpenAI 研究人员推出了 E-MAML 和 E-RL²,这两种元强化学习算法旨在提升在复杂环境中的探索性能。

2109

OpenAI 机器人研究的要素

OpenAI 发布了八个模拟机器人环境和一个 Baselines 实现的 Hindsight Experience Replay (HER),以便在复杂的操作任务中通过稀疏奖励实现强化学习。

2110

OpenAI 多目标强化学习机器人环境

OpenAI 已发布一套具有挑战性的连续控制机器人任务,已与 OpenAI Gym 集成,以推进多目标强化学习的研究。

2111

OpenAI 2018 年 3 月黑客松

OpenAI 在 2018 年 3 月 3 日于旧金山举办了一场社区黑客松和一系列讲座,以鼓励 AI 学习和项目开发。

2112

OpenAI 支持者和组织更新

OpenAI 宣布了新捐赠者、顾问任命以及埃隆·马斯克离开其董事会,以避免与特斯拉 AI 重点可能产生的冲突。

2113

OpenAI 正在为 AI 的恶意使用做准备

OpenAI 及其合作伙伴发布了一份研究论文,预测 AI 可能被恶意行为者滥用的方式,并提供了缓解这些全球安全威胁的建议。

2114

OpenAI 通过教学实现可解释的机器学习

OpenAI 提出了一种机器教学方法,该方法使用教师-学生神经网络框架来识别概念的最具说明性的示例,确保得到的解释是人类可解释的,而不是任意的。

2115

OpenAI 发现实体消歧的类型

OpenAI 开发了一种系统,该系统使用神经网络预测自动发现的类型的成员资格,以提高 CoNLL 和 TAC KBP 2010 数据集上的实体消歧准确率。

2116

OpenAI 研究请求 2.0

OpenAI 发布了研究请求 2.0,这是一系列七个未解决的强化学习和机器学习技术问题,旨在鼓励社区贡献。

2117

将 Kubernetes 扩展到 2,500 个节点

OpenAI 描述了为在 Azure 上进行深度学习研究而将 Kubernetes 集群扩展到 2,500 个节点所需的技术优化,解决了 etcd、网络和镜像拉取方面的瓶颈。

2118

OpenAI 块稀疏 GPU 内核

OpenAI 已发布高度优化的 GPU 内核,用于块稀疏神经网络架构,使得模型可以更宽更深,同时运行速度比 cuBLAS 或 cuSPARSE 快几个数量级。

2119

OpenAI 通过 L0 正则化学习稀疏神经网络

OpenAI 引入了一种在神经网络中使用 L0 范数正则化的方法,通过使用随机门将权重精确置零,从而创建稀疏模型,提升训练速度、推理速度和泛化能力。

2120

OpenAI 可解释和教学示例研究

OpenAI 研究人员表明,以迭代而非联合的方式训练教师和学生神经网络,可以产生既能有效教授 AI 又能教授人类的可解释教学策略。

2121

OpenAI 层级学习研究

OpenAI 已开发出 Meta-Learning Shared Hierarchies (MLSH),这是一种强化学习算法,能够自动发现高层次动作,以比暴力方法更高效的方式解决复杂的长时序任务。

2122

OpenAI 从仿真中泛化

OpenAI 使用动力学和域随机化技术在仿真中训练机器人控制器,使其能够泛化到真实机器人并对未计划的环境变化做出反应。

2123

OpenAI 通过动态随机化实现机器人控制的仿真到真实迁移

OpenAI 研究者开发了一种动态随机化方法,使得仅在仿真中训练的机器人控制策略能够无需进一步的物理训练直接迁移到真实硬件。

2124

OpenAI 非对称演员-评论家用于基于图像的机器人学习

OpenAI 提出了一种非对称演员-评论家框架,通过在完整仿真器状态上训练评论家而演员仅依赖 RGBD 图像,从而在不使用真实世界数据的情况下实现高效的仿真到真实世界迁移。

2125

OpenAI 域随机化和生成模型用于机器人抓取

OpenAI 使用域随机化和一个自回归模型开发了一个数据生成管道,以仅使用模拟训练数据在未见过的对象上实现 80% 的真实世界抓取成功率。

2126

OpenAI 元学习用于摔跤

OpenAI 表明,元学习代理可以快速调整其策略以击败更强的固定策略代理,并在模拟机器人摔跤中从物理故障中恢复。

2127

OpenAI 竞争性自我对弈研究

OpenAI 表明竞争性自我对弈使得模拟的 3D 机器人能够自主发现诸如擒抱和潜水之类的复杂身体技能,而无需明确的人类设计。

2128

非线性计算在深度线性网络中

OpenAI 研究人员发现,深度线性网络可以通过利用零附近的浮点算术下溢来执行非线性计算。

2129

OpenAI 和 Oxford 为多智能体强化学习引入 LOLA

OpenAI 和牛津大学开发了 Learning with Opponent-Learning Awareness (LOLA),一种通过塑造其他智能体的学习来实现互利结果的 RL 智能体。

2130

OpenAI 具有对手学习意识的学习 (LOLA)

OpenAI 提出了具有对手学习意识的学习 (LOLA),这是一种多智能体强化学习方法,使智能体能够塑造其他智能体的学习,以促进合作并达到纳什均衡。

2131

OpenAI Baselines: ACKTR & A2C

OpenAI 发布了 Baselines 框架的 ACKTR 和 A2C 实现,提供了一种更具样本效率的强化学习算法(ACKTR)以及 A3C 的同步确定性变体(A2C)。

2132

OpenAI Dota 2 1v1 机器人结果

OpenAI 开发了一种强化学习智能体,在 Dota 2 1v1 中实现了超人类表现,表明自博弈可以将机器学习系统扩展到超越人类水平的能力。

2133

OpenAI Dota 2 机器人公告

OpenAI 已开发出一种机器人,能够在 1v1 比赛中击败顶级职业 Dota 2 选手,使用自我对弈强化学习,且不依赖模仿学习或树搜索。

2134

OpenAI RL-Teacher 发布

OpenAI 已发布 RL-Teacher,这是一个开源界面,允许 AI 代理通过偶尔的人类反馈而不是手工制作的奖励函数进行训练。

2135

OpenAI 通过参数噪声实现更好的探索

OpenAI 引入了一种向神经网络参数而非动作空间添加自适应噪声的方法,显著提升了强化学习的性能和探索一致性。

2136

Proximal Policy Optimization (PPO) 发布说明 – OpenAI Baselines

OpenAI 发布了 Proximal Policy Optimization (PPO),这是一种易于实现的强化学习算法,其性能达到或超过了最先进的水平,并已成为 OpenAI 的默认 RL 方法。

2137

OpenAI 鲁棒对抗性输入研究

OpenAI 已开发出在不同尺度和视角下仍保持对抗性的图像,质疑了诸如自动驾驶汽车等系统通过多视角图像捕获可以防止恶意欺骗的观念。

2138

OpenAI 后经验重放

OpenAI 提出了 Hindsight Experience Replay,一种通过将失败的尝试视为替代目标的成功实现,从而实现稀疏、二元奖励下的样本高效强化学习的技术。

2139

OpenAI 教师-学生课程学习

OpenAI 引入了教师-学生课程学习(TSCL),这是一个自动框架,通过根据学生的学习进度和性能衰退选择子任务来优化训练。

2140

mujoco-py 1.50.1.0 发行说明 / 新功能

OpenAI 已开源 mujoco-py 1.50.1.0,这是一个高性能的 Python 3 绑定,用于 MuJoCo 引擎,引入了批量模拟和 GPU 加速渲染。

2141

OpenAI 从人类偏好中学习

OpenAI 和 DeepMind 开发了一种强化学习算法,能够从人类偏好比较中推断目标,从而减少对手动编写奖励函数的需求。

2142

OpenAI MADDPG: 学习合作、竞争与沟通

OpenAI 推出了 MADDPG,这是一种强化学习算法,它利用中心化学习与去中心化执行,使多个智能体能够在复杂环境中进行协作与竞争。

2143

OpenAI 通过 Q-Ensembles 进行 UCB 探索

OpenAI 研究者开发了一种基于 Upper-Confidence Bounds (UCB) 的 Q*-函数集合的探索策略,以提高深度强化学习在 Atari 基准上的性能。

2144

OpenAI Baselines: DQN 发布和强化学习最佳实践

OpenAI 已开源 OpenAI Baselines,首先提供 DQN 及其三个变体的高性能实现,以提高强化学习的可重复性。

2145

OpenAI 会学习的机器人:一次性模仿学习来自模拟

OpenAI 已开发出一种完全在模拟中训练的机器人系统,能够通过 VR 提供的人类单次演示学习新任务。

2146

OpenAI Roboschool 发布

OpenAI 已发布 Roboschool,一个用于强化学习的基于物理的环境集合,将 MuJoCo 任务移植到 Bullet 物理引擎,并引入了交互控制和多玩家训练的新挑战。

2147

策略梯度与软 Q-learning 的等价

OpenAI 研究者表明,软(熵正则化) Q-learning 在数学上等价于策略梯度方法,为两种主要的无模型强化学习方法提供了理论桥梁。

2148

随机神经网络用于层次强化学习

OpenAI 研究者提出了一种框架,使用随机神经网络和信息论正则化器来预训练可解释的技能,以加速在稀疏奖励的下游任务中的学习。

2149

OpenAI 无监督情感神经元

OpenAI 开发了一个无监督系统,通过预测 Amazon 评论中的下一个字符来学习情感表示,在 Stanford Sentiment Treebank 上实现了显著减少标注样本的情况下达到最先进的准确率。

2150

OpenAI 在物理世界中的 Spam 检测

OpenAI 通过域随机化在仿真中完全训练的基于 VGG16 的神经网络开发了一种能够检测物理世界中 Spam 罐头的机器人系统。