归档 · 11 个实验室 · 1,214 篇 dispatch

实验室

不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。

1151

OpenAI 非对称演员-评论家用于基于图像的机器人学习

OpenAI 提出了一种非对称演员-评论家框架,通过在完整仿真器状态上训练评论家而演员仅依赖 RGBD 图像,从而在不使用真实世界数据的情况下实现高效的仿真到真实世界迁移。

1152

OpenAI 域随机化和生成模型用于机器人抓取

OpenAI 使用域随机化和一个自回归模型开发了一个数据生成管道,以仅使用模拟训练数据在未见过的对象上实现 80% 的真实世界抓取成功率。

1153

OpenAI 元学习用于摔跤

OpenAI 表明,元学习代理可以快速调整其策略以击败更强的固定策略代理,并在模拟机器人摔跤中从物理故障中恢复。

1154

OpenAI 竞争性自我对弈研究

OpenAI 表明竞争性自我对弈使得模拟的 3D 机器人能够自主发现诸如擒抱和潜水之类的复杂身体技能,而无需明确的人类设计。

1155

非线性计算在深度线性网络中

OpenAI 研究人员发现,深度线性网络可以通过利用零附近的浮点算术下溢来执行非线性计算。

1156

OpenAI 和 Oxford 为多智能体强化学习引入 LOLA

OpenAI 和牛津大学开发了 Learning with Opponent-Learning Awareness (LOLA),一种通过塑造其他智能体的学习来实现互利结果的 RL 智能体。

1157

OpenAI 具有对手学习意识的学习 (LOLA)

OpenAI 提出了具有对手学习意识的学习 (LOLA),这是一种多智能体强化学习方法,使智能体能够塑造其他智能体的学习,以促进合作并达到纳什均衡。

1158

OpenAI Baselines: ACKTR & A2C

OpenAI 发布了 Baselines 框架的 ACKTR 和 A2C 实现,提供了一种更具样本效率的强化学习算法(ACKTR)以及 A3C 的同步确定性变体(A2C)。

1159

OpenAI Dota 2 1v1 机器人结果

OpenAI 开发了一种强化学习智能体,在 Dota 2 1v1 中实现了超人类表现,表明自博弈可以将机器学习系统扩展到超越人类水平的能力。

1160

OpenAI Dota 2 机器人公告

OpenAI 已开发出一种机器人,能够在 1v1 比赛中击败顶级职业 Dota 2 选手,使用自我对弈强化学习,且不依赖模仿学习或树搜索。

1161

OpenAI RL-Teacher 发布

OpenAI 已发布 RL-Teacher,这是一个开源界面,允许 AI 代理通过偶尔的人类反馈而不是手工制作的奖励函数进行训练。

1162

OpenAI 通过参数噪声实现更好的探索

OpenAI 引入了一种向神经网络参数而非动作空间添加自适应噪声的方法,显著提升了强化学习的性能和探索一致性。

1163

Proximal Policy Optimization (PPO) 发布说明 – OpenAI Baselines

OpenAI 发布了 Proximal Policy Optimization (PPO),这是一种易于实现的强化学习算法,其性能达到或超过了最先进的水平,并已成为 OpenAI 的默认 RL 方法。

1164

OpenAI 鲁棒对抗性输入研究

OpenAI 已开发出在不同尺度和视角下仍保持对抗性的图像,质疑了诸如自动驾驶汽车等系统通过多视角图像捕获可以防止恶意欺骗的观念。

1165

OpenAI 后经验重放

OpenAI 提出了 Hindsight Experience Replay,一种通过将失败的尝试视为替代目标的成功实现,从而实现稀疏、二元奖励下的样本高效强化学习的技术。

1166

OpenAI 教师-学生课程学习

OpenAI 引入了教师-学生课程学习(TSCL),这是一个自动框架,通过根据学生的学习进度和性能衰退选择子任务来优化训练。

1167

mujoco-py 1.50.1.0 发行说明 / 新功能

OpenAI 已开源 mujoco-py 1.50.1.0,这是一个高性能的 Python 3 绑定,用于 MuJoCo 引擎,引入了批量模拟和 GPU 加速渲染。

1168

OpenAI 从人类偏好中学习

OpenAI 和 DeepMind 开发了一种强化学习算法,能够从人类偏好比较中推断目标,从而减少对手动编写奖励函数的需求。

1169

OpenAI MADDPG: 学习合作、竞争与沟通

OpenAI 推出了 MADDPG,这是一种强化学习算法,它利用中心化学习与去中心化执行,使多个智能体能够在复杂环境中进行协作与竞争。

1170

OpenAI 通过 Q-Ensembles 进行 UCB 探索

OpenAI 研究者开发了一种基于 Upper-Confidence Bounds (UCB) 的 Q*-函数集合的探索策略,以提高深度强化学习在 Atari 基准上的性能。

1171

OpenAI Baselines: DQN 发布和强化学习最佳实践

OpenAI 已开源 OpenAI Baselines,首先提供 DQN 及其三个变体的高性能实现,以提高强化学习的可重复性。

1172

OpenAI 会学习的机器人:一次性模仿学习来自模拟

OpenAI 已开发出一种完全在模拟中训练的机器人系统,能够通过 VR 提供的人类单次演示学习新任务。

1173

OpenAI Roboschool 发布

OpenAI 已发布 Roboschool,一个用于强化学习的基于物理的环境集合,将 MuJoCo 任务移植到 Bullet 物理引擎,并引入了交互控制和多玩家训练的新挑战。

1174

策略梯度与软 Q-learning 的等价

OpenAI 研究者表明,软(熵正则化) Q-learning 在数学上等价于策略梯度方法,为两种主要的无模型强化学习方法提供了理论桥梁。

1175

随机神经网络用于层次强化学习

OpenAI 研究者提出了一种框架,使用随机神经网络和信息论正则化器来预训练可解释的技能,以加速在稀疏奖励的下游任务中的学习。

1176

OpenAI 无监督情感神经元

OpenAI 开发了一个无监督系统,通过预测 Amazon 评论中的下一个字符来学习情感表示,在 Stanford Sentiment Treebank 上实现了显著减少标注样本的情况下达到最先进的准确率。

1177

OpenAI 在物理世界中的 Spam 检测

OpenAI 通过域随机化在仿真中完全训练的基于 VGG16 的神经网络开发了一种能够检测物理世界中 Spam 罐头的机器人系统。

1178

进化策略作为强化学习的可伸缩替代方案

OpenAI 研究者表明,进化策略(ES)在 Atari 和 MuJoCo 基准测试上可以与标准强化学习的性能相媲美,同时提供更优的可伸缩性和更简单的实现。

1179

OpenAI 一次性模仿学习

OpenAI 提出了一种用于一次性模仿学习的元学习框架,使机器人能够从单次演示中学习新任务,并在无需特定任务工程的情况下泛化到新情境。

1180

OpenAI 对 Distill 期刊发布的支持

OpenAI 宣布支持 Distill,这是一本利用现代网络技术改进机器学习结果传播的新期刊。

1181

学习交流:OpenAI 2017 年关于涌现 AI 语言的研究

OpenAI 的 2017 年《学习交流》工作展示了强化学习智能体如何在简单的模拟世界中发明出基础且组合式的语言以解决合作任务。

1182

多智能体群体中基础组合语言的出现

OpenAI 研究人员表明,基础组合语言可以在多智能体群体中出现,展示了智能体如何发展出一种结构化的基于符号的通信系统以实现目标。

1183

OpenAI 基于时间段模型的预测与控制

OpenAI 提出了一种深度生成模型,该模型在时间段而非离散时间步上预测未来状态轨迹,从而为复杂非线性系统实现稳定的长时域预测。

1184

OpenAI 第三人称模仿学习

OpenAI 提出了一种无监督的第三人称模仿学习方法,使得智能体能够从不同视角提供的示范中学习任务,而无需显式的状态对应。

1185

使用对抗性样本攻击机器学习

OpenAI 探讨了对抗性样本——故意设计的导致机器学习模型失效的输入——如何凸显监督学习和强化学习中的关键漏洞,为 AI 安全带来重大挑战。

1186

对神经网络策略的对抗攻击

OpenAI 研究人员表明,强化学习中的神经网络策略对微小且不可感知的对抗扰动具有脆弱性,这些扰动会在各种任务和训练算法中显著降低性能。

1187

OpenAI 团队更新 2017年1月

OpenAI 在 2017 年 1 月将团队扩大至 45 名成员,增加了机器人、分布式系统和优化领域的专家,以推进 AI 能力。

1188

PixelCNN++:通过离散化 logistic 混合似然及其他修改改进 PixelCNN

OpenAI 发布了 PixelCNN++,这是一个增强的 PixelCNN 实现,它将 256 方式的 softmax 替换为离散化 logistic 混合似然,对整个像素进行条件化,添加了下采样、快捷连接和 dropout,在 CIFAR-10 上实现了最先进的对数似然。

1189

OpenAI: 野外的故障奖励函数

OpenAI 指出强化学习中奖励错配的风险,即代理利用不完美的代理通过非预期行为获得高分。

1190

OpenAI 宇宙

OpenAI 宇宙是一个通用的 AI 训练平台,允许代理通过屏幕像素和虚拟键盘/鼠标输入与任何计算机程序进行交互,以促进通用智能的发展。

1191

OpenAI 和 Microsoft 合作伙伴关系公告

OpenAI 已与 Microsoft 合作,将 Azure 作为其深度学习和 AI 研究的主要云平台,以加速其实验的规模。

1192

OpenAI 关于深度强化学习的基于计数的探索研究

OpenAI 研究人员表明,经典基于计数的探索的简单推广——使用哈希码将高维状态映射到计数——可以在深度强化学习中达到接近最先进的性能。

1193

基于解码器的生成模型的定量分析

OpenAI 研究者提出使用 Annealed Importance Sampling 来准确评估基于解码器的生成模型的对数似然,以解决仅凭简单样本检查难以量化性能的问题。

1194

OpenAI: GANs、逆强化学习和基于能量的模型之间的联系

OpenAI 研究人员表明,某些逆强化学习(IRL)方法,特别是最大熵 IRL,在数学上等价于生成对抗网络(GANs)和基于能量的模型(EBMs)。

1195

OpenAI RL²: 通过慢速强化学习实现快速强化学习

OpenAI 提出 RL²,一种使用循环神经网络(RNN)来学习强化学习算法的方法,通过将学习过程本身编码到 RNN 权重中,使代理能够在少数试验中适应新任务。

1196

OpenAI 变分损失自编码器研究

OpenAI 提出了一种将变分自编码器(VAE)与神经自回归模型相结合的变分损失自编码器,以学习全局表示同时丢弃无关的局部细节,如图像纹理。

1197

OpenAI 神经GPU:扩展与局限

OpenAI 研究人员通过使用课程学习和增加模型规模,提高了神经GPU学习诸如十进制算术和复杂表达式之类算法任务的能力。

1198

OpenAI 半监督知识迁移用于私有训练数据

OpenAI 引入了 Private Aggregation of Teacher Ensembles (PATE),这是一种框架,通过教师模型之间的噪声投票来训练学生模型,具有强大的差分隐私保证。

1199

OpenAI 自组织机器学习会议(SOCML)

OpenAI 举办了其首届自组织机器学习会议,通过同伴间教育和 150 名 AI 从业者之间的偶然互动来加速 AI 研究。

1200

通过学习深度逆动力学模型将仿真迁移到真实世界 – OpenAI 2016

OpenAI 研究者提出了一种方法,通过学习深度逆动力学模型将仿真中学习的控制策略映射到适当的真实世界动作,从而在不需要准确动力学模型的情况下减小仿真到真实世界的差距。