学习协作、竞争与交流 – OpenAI 2017 研究公告
OpenAI 在 2017 年 6 月推出了 MADDPG,这是一种集中式 critic 多智能体强化学习算法,旨在使智能体能够在共享环境中学习协作、竞争和交流。
OpenAI 通过 Q-Ensembles 进行 UCB 探索
OpenAI 研究者开发了一种基于 Upper-Confidence Bounds (UCB) 的 Q*-函数集合的探索策略,以提高深度强化学习在 Atari 基准上的性能。
OpenAI Baselines: DQN 发布和强化学习最佳实践
OpenAI 已开源 OpenAI Baselines,首先提供 DQN 及其三个变体的高性能实现,以提高强化学习的可重复性。
OpenAI 会学习的机器人:一次性模仿学习来自模拟
OpenAI 已开发出一种完全在模拟中训练的机器人系统,能够通过 VR 提供的人类单次演示学习新任务。
OpenAI Roboschool 发布
OpenAI 已发布 Roboschool,一个用于强化学习的基于物理的环境集合,将 MuJoCo 任务移植到 Bullet 物理引擎,并引入了交互控制和多玩家训练的新挑战。
策略梯度与软 Q-learning 的等价
OpenAI 研究者表明,软(熵正则化) Q-learning 在数学上等价于策略梯度方法,为两种主要的无模型强化学习方法提供了理论桥梁。
随机神经网络用于层次强化学习
OpenAI 研究者提出了一种框架,使用随机神经网络和信息论正则化器来预训练可解释的技能,以加速在稀疏奖励的下游任务中的学习。
OpenAI 无监督情感神经元
OpenAI 开发了一个无监督系统,通过预测 Amazon 评论中的下一个字符来学习情感表示,在 Stanford Sentiment Treebank 上实现了显著减少标注样本的情况下达到最先进的准确率。
OpenAI 在物理世界中的 Spam 检测
OpenAI 通过域随机化在仿真中完全训练的基于 VGG16 的神经网络开发了一种能够检测物理世界中 Spam 罐头的机器人系统。
进化策略作为强化学习的可伸缩替代方案
OpenAI 研究者表明,进化策略(ES)在 Atari 和 MuJoCo 基准测试上可以与标准强化学习的性能相媲美,同时提供更优的可伸缩性和更简单的实现。
OpenAI 一次性模仿学习
OpenAI 提出了一种用于一次性模仿学习的元学习框架,使机器人能够从单次演示中学习新任务,并在无需特定任务工程的情况下泛化到新情境。
OpenAI 对 Distill 期刊发布的支持
OpenAI 宣布支持 Distill,这是一本利用现代网络技术改进机器学习结果传播的新期刊。
学习交流:OpenAI 2017 年关于涌现 AI 语言的研究
OpenAI 的 2017 年《学习交流》工作展示了强化学习智能体如何在简单的模拟世界中发明出基础且组合式的语言以解决合作任务。
多智能体群体中基础组合语言的出现
OpenAI 研究人员表明,基础组合语言可以在多智能体群体中出现,展示了智能体如何发展出一种结构化的基于符号的通信系统以实现目标。
OpenAI 基于时间段模型的预测与控制
OpenAI 提出了一种深度生成模型,该模型在时间段而非离散时间步上预测未来状态轨迹,从而为复杂非线性系统实现稳定的长时域预测。
OpenAI 第三人称模仿学习
OpenAI 提出了一种无监督的第三人称模仿学习方法,使得智能体能够从不同视角提供的示范中学习任务,而无需显式的状态对应。
使用对抗性样本攻击机器学习
OpenAI 探讨了对抗性样本——故意设计的导致机器学习模型失效的输入——如何凸显监督学习和强化学习中的关键漏洞,为 AI 安全带来重大挑战。
对神经网络策略的对抗攻击
OpenAI 研究人员表明,强化学习中的神经网络策略对微小且不可感知的对抗扰动具有脆弱性,这些扰动会在各种任务和训练算法中显著降低性能。
OpenAI 团队更新 2017年1月
OpenAI 在 2017 年 1 月将团队扩大至 45 名成员,增加了机器人、分布式系统和优化领域的专家,以推进 AI 能力。
PixelCNN++:通过离散化 logistic 混合似然及其他修改改进 PixelCNN
OpenAI 发布了 PixelCNN++,这是一个增强的 PixelCNN 实现,它将 256 方式的 softmax 替换为离散化 logistic 混合似然,对整个像素进行条件化,添加了下采样、快捷连接和 dropout,在 CIFAR-10 上实现了最先进的对数似然。
OpenAI: 野外的故障奖励函数
OpenAI 指出强化学习中奖励错配的风险,即代理利用不完美的代理通过非预期行为获得高分。
OpenAI 宇宙
OpenAI 宇宙是一个通用的 AI 训练平台,允许代理通过屏幕像素和虚拟键盘/鼠标输入与任何计算机程序进行交互,以促进通用智能的发展。
OpenAI 和 Microsoft 合作伙伴关系公告
OpenAI 已与 Microsoft 合作,将 Azure 作为其深度学习和 AI 研究的主要云平台,以加速其实验的规模。
OpenAI 关于深度强化学习的基于计数的探索研究
OpenAI 研究人员表明,经典基于计数的探索的简单推广——使用哈希码将高维状态映射到计数——可以在深度强化学习中达到接近最先进的性能。
基于解码器的生成模型的定量分析
OpenAI 研究者提出使用 Annealed Importance Sampling 来准确评估基于解码器的生成模型的对数似然,以解决仅凭简单样本检查难以量化性能的问题。
OpenAI: GANs、逆强化学习和基于能量的模型之间的联系
OpenAI 研究人员表明,某些逆强化学习(IRL)方法,特别是最大熵 IRL,在数学上等价于生成对抗网络(GANs)和基于能量的模型(EBMs)。
OpenAI RL²: 通过慢速强化学习实现快速强化学习
OpenAI 提出 RL²,一种使用循环神经网络(RNN)来学习强化学习算法的方法,通过将学习过程本身编码到 RNN 权重中,使代理能够在少数试验中适应新任务。
OpenAI 变分损失自编码器研究
OpenAI 提出了一种将变分自编码器(VAE)与神经自回归模型相结合的变分损失自编码器,以学习全局表示同时丢弃无关的局部细节,如图像纹理。
OpenAI 神经GPU:扩展与局限
OpenAI 研究人员通过使用课程学习和增加模型规模,提高了神经GPU学习诸如十进制算术和复杂表达式之类算法任务的能力。
OpenAI 半监督知识迁移用于私有训练数据
OpenAI 引入了 Private Aggregation of Teacher Ensembles (PATE),这是一种框架,通过教师模型之间的噪声投票来训练学生模型,具有强大的差分隐私保证。
OpenAI 自组织机器学习会议(SOCML)
OpenAI 举办了其首届自组织机器学习会议,通过同伴间教育和 150 名 AI 从业者之间的偶然互动来加速 AI 研究。
通过学习深度逆动力学模型将仿真迁移到真实世界 – OpenAI 2016
OpenAI 研究者提出了一种方法,通过学习深度逆动力学模型将仿真中学习的控制策略映射到适当的真实世界动作,从而在不需要准确动力学模型的情况下减小仿真到真实世界的差距。
OpenAI 深度学习基础设施与 Kubernetes-EC2 自动扩缩器
OpenAI 发布了其深度学习基础设施实践,并推出了 Kubernetes‑EC2 自动扩缩器,帮助研究人员在 AWS 与本地 GPU 集群之间扩展突发工作负载。
OpenAI 机器学习非正式会议 2016 公告
OpenAI 宣布将于 2016 年 10 月 7‑8 日在其旧金山办公室举办免费的机器学习非正式会议,旨在促进机器学习研究者和从业者之间的参与者驱动的讨论和交流。
OpenAI 团队更新 2016 年 8 月:新全职招聘和实习生
2016 年 8 月 16 日,OpenAI 宣布新增五名全职研究员和工程师以及若干实习生和访问者,扩展了其在语音、安全、战略、GPU 优化、深度学习及相关领域的专业知识。
OpenAI 特别项目 2016
OpenAI 在 2016 年宣布了一份四个优先问题领域的清单,旨在推进 AI 能力并减轻社会风险,包括 AI 检测、自动编程、网络安全和复杂模拟。
OpenAI 与 Google Brain:AI 安全的具体问题
OpenAI、Google Brain、伯克利和斯坦福的研究人员确定了 AI 安全的五个核心技术挑战,以确保现代机器学习系统按预期运行。
OpenAI 技术目标(2016)
OpenAI 在 2016 年概述了其早期技术路线图,重点在于创建通用智能度量并开发能够实现机器人技术、自然语言理解以及多游戏精通的智能体。
OpenAI 生成模型研究概览
OpenAI 阐述了生成模型在实现机器对世界理解中的作用,并介绍了五项改进 GANs、VAEs 和强化学习的研究项目。
OpenAI 团队更新 2016年5月
OpenAI 宣布新增若干全职员工和实习生,他们在深度学习、竞赛编程、AI 安全和基础设施工程方面具有专业知识。
半监督文本分类的对抗训练方法
OpenAI 研究者通过在循环神经网络中扰动词嵌入,提出了一种将对抗训练和虚拟对抗训练应用于文本的方法,在半监督文本分类任务上取得了最先进的结果。
OpenAI Gym Beta 发布
OpenAI 已发布 OpenAI Gym 的公开测试版,这是一个旨在标准化强化学习环境并加速算法开发与比较的工具包。
OpenAI 团队更新:Pieter Abbeel 与 Shivon Zilis 加入
OpenAI 于 2016 年 4 月宣布 Pieter Abbeel 加入为全职团队成员,Shivon Zilis 加入为官方顾问。
OpenAI Team++ 更新
OpenAI 宣布增加了若干知名机器学习研究员和实习生,将当前工作重点放在无监督学习和强化学习上。
权重归一化:加速深度神经网络训练
OpenAI 研究者提出了权重归一化,这是一种重新参数化的技术,它将权重向量的长度与方向解耦,以在不引入批量归一化的小批量依赖的情况下加速随机梯度下降的收敛。
介绍 OpenAI:非营利 AI 研究计划(2015 年 12 月)
2015 年 12 月 11 日,OpenAI 宣布成立,作为一家非营利 AI 研究组织,致力于在不受财务约束的情况下推动数字智能,以广泛惠及人类。