1001

通过辩论实现 AI 安全

OpenAI 提出了一种安全技术,通过训练 AI 代理进行辩论,以帮助人类监督执行超出人类认知能力任务的系统。

1002

OpenAI 进化策略梯度 (EPG)

OpenAI 介绍了进化策略梯度 (EPG),一种通过进化损失函数帮助强化学习代理在任务族内对新任务进行泛化的元学习方法。

1003

OpenAI 快速学习基准

OpenAI 推出了一个基于 Sonic the Hedgehog 视频游戏系列的新强化学习基准,用于衡量迁移学习和少样本学习的性能。

1004

OpenAI Retro 竞赛与 Gym Retro 发布

OpenAI 发起了 Retro 竞赛,以衡量强化学习在未见视频游戏关卡上的泛化能力,并发布了 Gym Retro——一个将 30 款 SEGA Genesis 和 62 款 Atari 2600 游戏集成到 Gym 中的平台。

1005

OpenAI 基于动作依赖因子化基线的策略梯度方差降低

OpenAI 的研究人员开发了一种无偏的动作依赖基线用于策略梯度方法,以降低梯度估计的方差,从而在高维动作空间中实现更快的学习。

1006

OpenAI OT-GAN:使用最优传输改进 GAN

OpenAI 推出最优传输 GAN(OT-GAN),这是一种使用新型小批量能量距离度量来提升训练稳定性和图像生成质量的生成对抗网络变体。

1007

OpenAI 2018年3月黑客马拉松报告

OpenAI 于 2018 年 3 月 3 日举办了首次黑客马拉松,汇聚了 100 名 AI 社区成员,开发涵盖医疗、安全和强化学习的项目。

1008

关于一阶元学习算法

OpenAI 介绍了 Reptile,这是一种一阶元学习算法,通过优化参数初始化,使代理能够在新任务上快速学习,而无需二阶导数。

1009

OpenAI Reptile:可扩展的元学习算法

OpenAI 推出了 Reptile,这是一种可扩展的元学习算法,通过最大化同一任务不同小批量梯度之间的内积,使模型能够从少量示例中实现泛化。

1010

OpenAI 学者计划

OpenAI 推出了 OpenAI 学者计划,为弱势群体的个人提供补助金和导师指导,以学习深度学习并开源项目。

1011

OpenAI 研究:通过元强化学习学习探索

OpenAI 研究人员推出了 E-MAML 和 E-RL²,这两种元强化学习算法旨在提升在复杂环境中的探索性能。

1012

OpenAI 机器人研究的要素

OpenAI 发布了八个模拟机器人环境和一个 Baselines 实现的 Hindsight Experience Replay (HER),以便在复杂的操作任务中通过稀疏奖励实现强化学习。

1013

OpenAI 多目标强化学习机器人环境

OpenAI 已发布一套具有挑战性的连续控制机器人任务,已与 OpenAI Gym 集成,以推进多目标强化学习的研究。

1014

OpenAI 2018 年 3 月黑客松

OpenAI 在 2018 年 3 月 3 日于旧金山举办了一场社区黑客松和一系列讲座,以鼓励 AI 学习和项目开发。

1015

OpenAI 支持者和组织更新

OpenAI 宣布了新捐赠者、顾问任命以及埃隆·马斯克离开其董事会,以避免与特斯拉 AI 重点可能产生的冲突。

1016

OpenAI 正在为 AI 的恶意使用做准备

OpenAI 及其合作伙伴发布了一份研究论文,预测 AI 可能被恶意行为者滥用的方式,并提供了缓解这些全球安全威胁的建议。

1017

OpenAI 通过教学实现可解释的机器学习

OpenAI 提出了一种机器教学方法,该方法使用教师-学生神经网络框架来识别概念的最具说明性的示例,确保得到的解释是人类可解释的,而不是任意的。

1018

OpenAI 发现实体消歧的类型

OpenAI 开发了一种系统,该系统使用神经网络预测自动发现的类型的成员资格,以提高 CoNLL 和 TAC KBP 2010 数据集上的实体消歧准确率。

1019

OpenAI 研究请求 2.0

OpenAI 发布了研究请求 2.0,这是一系列七个未解决的强化学习和机器学习技术问题,旨在鼓励社区贡献。

1020

将 Kubernetes 扩展到 2,500 个节点

OpenAI 描述了为在 Azure 上进行深度学习研究而将 Kubernetes 集群扩展到 2,500 个节点所需的技术优化,解决了 etcd、网络和镜像拉取方面的瓶颈。

1021

OpenAI 块稀疏 GPU 内核

OpenAI 已发布高度优化的 GPU 内核,用于块稀疏神经网络架构,使得模型可以更宽更深,同时运行速度比 cuBLAS 或 cuSPARSE 快几个数量级。

1022

OpenAI 通过 L0 正则化学习稀疏神经网络

OpenAI 引入了一种在神经网络中使用 L0 范数正则化的方法,通过使用随机门将权重精确置零,从而创建稀疏模型,提升训练速度、推理速度和泛化能力。

1023

OpenAI 可解释和教学示例研究

OpenAI 研究人员表明,以迭代而非联合的方式训练教师和学生神经网络,可以产生既能有效教授 AI 又能教授人类的可解释教学策略。

1024

OpenAI 层级学习研究

OpenAI 已开发出 Meta-Learning Shared Hierarchies (MLSH),这是一种强化学习算法,能够自动发现高层次动作,以比暴力方法更高效的方式解决复杂的长时序任务。

1025

OpenAI 从仿真中泛化

OpenAI 使用动力学和域随机化技术在仿真中训练机器人控制器,使其能够泛化到真实机器人并对未计划的环境变化做出反应。

1026

OpenAI 通过动态随机化实现机器人控制的仿真到真实迁移

OpenAI 研究者开发了一种动态随机化方法,使得仅在仿真中训练的机器人控制策略能够无需进一步的物理训练直接迁移到真实硬件。

1027

OpenAI 非对称演员-评论家用于基于图像的机器人学习

OpenAI 提出了一种非对称演员-评论家框架,通过在完整仿真器状态上训练评论家而演员仅依赖 RGBD 图像,从而在不使用真实世界数据的情况下实现高效的仿真到真实世界迁移。

1028

OpenAI 域随机化和生成模型用于机器人抓取

OpenAI 使用域随机化和一个自回归模型开发了一个数据生成管道,以仅使用模拟训练数据在未见过的对象上实现 80% 的真实世界抓取成功率。

1029

OpenAI 元学习用于摔跤

OpenAI 表明,元学习代理可以快速调整其策略以击败更强的固定策略代理,并在模拟机器人摔跤中从物理故障中恢复。

1030

OpenAI 竞争性自我对弈研究

OpenAI 表明竞争性自我对弈使得模拟的 3D 机器人能够自主发现诸如擒抱和潜水之类的复杂身体技能,而无需明确的人类设计。

1031

非线性计算在深度线性网络中

OpenAI 研究人员发现,深度线性网络可以通过利用零附近的浮点算术下溢来执行非线性计算。

1032

OpenAI 和 Oxford 为多智能体强化学习引入 LOLA

OpenAI 和牛津大学开发了 Learning with Opponent-Learning Awareness (LOLA),一种通过塑造其他智能体的学习来实现互利结果的 RL 智能体。

1033

OpenAI 具有对手学习意识的学习 (LOLA)

OpenAI 提出了具有对手学习意识的学习 (LOLA),这是一种多智能体强化学习方法,使智能体能够塑造其他智能体的学习,以促进合作并达到纳什均衡。

1034

OpenAI Baselines: ACKTR & A2C

OpenAI 发布了 Baselines 框架的 ACKTR 和 A2C 实现,提供了一种更具样本效率的强化学习算法(ACKTR)以及 A3C 的同步确定性变体(A2C)。

1035

OpenAI Dota 2 1v1 机器人结果

OpenAI 开发了一种强化学习智能体,在 Dota 2 1v1 中实现了超人类表现,表明自博弈可以将机器学习系统扩展到超越人类水平的能力。

1036

OpenAI Dota 2 机器人公告

OpenAI 已开发出一种机器人,能够在 1v1 比赛中击败顶级职业 Dota 2 选手,使用自我对弈强化学习,且不依赖模仿学习或树搜索。

1037

OpenAI RL-Teacher 发布

OpenAI 已发布 RL-Teacher,这是一个开源界面,允许 AI 代理通过偶尔的人类反馈而不是手工制作的奖励函数进行训练。

1038

参数噪声带来的更好探索

OpenAI 2017 年的研究表明,向强化学习策略添加自适应参数噪声可以改善探索并获得更高的分数,这一点在 HalfCheetah 和 Atari/Mujoco 基准测试中得到了验证。

1039

Proximal Policy Optimization (PPO) 发布说明 – OpenAI Baselines

OpenAI 发布了 Proximal Policy Optimization (PPO),这是一种易于实现的强化学习算法,其性能达到或超过了最先进的水平,并已成为 OpenAI 的默认 RL 方法。

1040

OpenAI 鲁棒对抗性输入研究

OpenAI 已开发出在不同尺度和视角下仍保持对抗性的图像,质疑了诸如自动驾驶汽车等系统通过多视角图像捕获可以防止恶意欺骗的观念。

1041

OpenAI 后经验重放

OpenAI 提出了 Hindsight Experience Replay,一种通过将失败的尝试视为替代目标的成功实现,从而实现稀疏、二元奖励下的样本高效强化学习的技术。

1042

OpenAI 教师-学生课程学习

OpenAI 引入了教师-学生课程学习(TSCL),这是一个自动框架,通过根据学生的学习进度和性能衰退选择子任务来优化训练。

1043

mujoco-py 1.50.1.0 发行说明 / 新功能

OpenAI 已开源 mujoco-py 1.50.1.0,这是一个高性能的 Python 3 绑定,用于 MuJoCo 引擎,引入了批量模拟和 GPU 加速渲染。

1044

OpenAI 从人类偏好中学习

OpenAI 和 DeepMind 开发了一种强化学习算法,能够从人类偏好比较中推断目标,从而减少对手动编写奖励函数的需求。

1045

学习协作、竞争与交流 – OpenAI 2017 研究公告

OpenAI 在 2017 年 6 月推出了 MADDPG,这是一种集中式 critic 多智能体强化学习算法,旨在使智能体能够在共享环境中学习协作、竞争和交流。

1046

OpenAI 通过 Q-Ensembles 进行 UCB 探索

OpenAI 研究者开发了一种基于 Upper-Confidence Bounds (UCB) 的 Q*-函数集合的探索策略,以提高深度强化学习在 Atari 基准上的性能。

1047

OpenAI Baselines: DQN 发布和强化学习最佳实践

OpenAI 已开源 OpenAI Baselines,首先提供 DQN 及其三个变体的高性能实现,以提高强化学习的可重复性。

1048

OpenAI 会学习的机器人:一次性模仿学习来自模拟

OpenAI 已开发出一种完全在模拟中训练的机器人系统,能够通过 VR 提供的人类单次演示学习新任务。

1049

OpenAI Roboschool 发布

OpenAI 已发布 Roboschool,一个用于强化学习的基于物理的环境集合,将 MuJoCo 任务移植到 Bullet 物理引擎,并引入了交互控制和多玩家训练的新挑战。

1050

策略梯度与软 Q-learning 的等价

OpenAI 研究者表明,软(熵正则化) Q-learning 在数学上等价于策略梯度方法,为两种主要的无模型强化学习方法提供了理论桥梁。