7551

AI 安全需要社会科学家

OpenAI 认为,长期的 AI 安全和对齐需要整合社会科学,以应对人类的认知偏见和人类价值观的复杂性。

7552

OpenAI GPT-2 发布及其影响

OpenAI 推出了 GPT-2,这是一种拥有 15 亿参数的无监督语言模型,能够实现零样本任务性能和连贯的文本生成,同时实施了分阶段发布策略以减轻滥用风险。

7553

OpenAI 研究:鲁棒分类中的计算限制

OpenAI 研究人员已经识别出一些分类任务,在这些任务中,鲁棒分类器存在但计算上无法学习,从而将鲁棒学习的难度与密码学原语的存在联系起来。

7554

OpenAI Summer Fellows 2018 Final Projects

OpenAI 的 2018 Summer Fellows 完成了专注于强化学习泛化、分布式训练模式和生成模型表达能力的研究项目。

7555

AI 训练规模化:通过梯度噪声尺度预测并行化能力

OpenAI 发现,梯度噪声尺度——一种量化网络梯度信噪比的统计指标——能够预测神经网络训练在各种任务中的最大有效批量大小。

7556

量化强化学习中的泛化

OpenAI 推出 CoinRun,这是一种程序化生成的训练环境,旨在量化并提升智能体在强化学习中将已学技能迁移到新情境的能力。

7557

OpenAI 深度强化学习入门(Spinning Up)

OpenAI 已发布 Spinning Up in Deep RL,这是一套教育资源,提供代码、教程和文档,帮助实践者掌握深度强化学习。

7558

OpenAI 使用能量函数学习概念

OpenAI 开发了一种使用能量函数的技术,使代理能够学习和提取概念,并在不同环境之间无需重新训练即可进行迁移。

7559

OpenAI 计划在线学习离线(POLO)框架

OpenAI 推出计划在线学习离线(POLO)框架,该框架结合了本地基于模型的控制和全局价值函数学习,以实现复杂模拟控制任务中的高效学习。

7560

OpenAI 随机网络蒸馏(RND)用于强化学习

OpenAI 引入了随机网络蒸馏(RND),一种好奇心驱动的探索方法,首次在不使用人类示范或模拟器状态的情况下,在 Montezuma's Revenge 上超越了平均人类表现。

7561

OpenAI 迭代放大用于复杂目标学习

OpenAI 提出迭代放大,这是一种 AI 安全技术,通过将任务分解为更简单的子任务来生成训练信号,从而实现对复杂、超出人类规模目标的指定。

7562

OpenAI 学者 2019 项目公告

OpenAI 已开启第二批 OpenAI Scholars 的申请,为来自弱势群体的个人提供津贴和导师指导,以学习深度学习并完成开源项目。

7563

OpenAI 2019 年冬季研究员计划与 2019 年夏季实习项目

OpenAI 宣布启动 2019 年冬季研究员项目和 2019 年夏季实习项目的申请,旨在将来自多元背景的研究人员和学生纳入其人工智能研究工作。

7564

FFJORD:用于可扩展可逆生成模型的自由形式连续动力学

OpenAI 介绍了 FFJORD,这是一种连续时间可逆生成模型,使用 Hutchinson 的迹估计器来实现对神经网络架构的无限制使用,以实现可扩展的密度估计。

7565

OpenAI 学者 2018 最终项目

OpenAI 发布了 2018 年学者计划的最终项目展示,涵盖了机器学习在音乐生成、直觉物理和自然语言处理等方面的多样化应用。

7566

OpenAI Five:The International 2018 结果

OpenAI Five 在 The International 2018 中与世界级职业 Dota 2 选手竞争,尽管在“真实 Dota”规则下两场均告失利,却展示了高水平的游戏表现。

7567

OpenAI 大规模好奇心驱动学习研究

OpenAI 研究人员展示了,仅使用基于预测误差的内在好奇心奖励进行训练的智能体,能够在 54 个基准环境中实现高性能,而无需任何手工设计的外部奖励。

7568

OpenAI Five 基准结果

OpenAI Five 在与 99.95 百分位 Dota 玩家组成的团队的三局两胜系列赛中获胜,展示了在处理复杂性和不确定性方面的先进 AI 能力。

7569

OpenAI Dactyl:通过域随机化学习灵巧性

OpenAI 开发了 Dactyl,这是一套在仿真中训练类人机器人手以高灵巧度操作物理物体的系统,能够将这些技能直接转移到真实世界而无需微调。

7570

OpenAI 变分选项发现算法

OpenAI 引入了通过强化学习的变分自编码选项学习 (VALOR) 和一种课程学习方法,以稳定强化学习智能体中多样行为模式的发现。

7571

OpenAI 学者 2018:认识我们的学者

OpenAI 推出了 2018 学者项目,汇聚了一支多元化的研究团队,专注于强化学习、语言建模以及 AI 与艺术的交叉等领域。

7572

OpenAI Five 基准测试

OpenAI 宣布了一场 OpenAI Five 的基准赛,扩展了英雄池并更新了游戏机制,以在高百分位的人类玩家中测试该 AI。

7573

Glow: 更好的可逆生成模型

OpenAI 引入 Glow,这是一种基于流的生成模型,使用可逆 1x1 卷积生成高分辨率图像,具备精确的潜在变量推断和高效采样能力。

7574

从单次示范学习蒙特祖玛的复仇

OpenAI 通过使用单个人类示范创建逆向课程的起始状态,训练出一个 RL 代理,在《蒙特祖玛的复仇》中取得了创纪录的 74,500 分。

7575

OpenAI Five

OpenAI Five,一个由五个神经网络组成的团队,通过在Dota 2上的自博弈训练,开始击败业余人类队伍,并表明扩大规模的强化学习可以在不需要根本算法进步的情况下处理长时延、部分可观测的任务。

7576

OpenAI 复古竞赛结果

OpenAI 完成了首届复古竞赛,Sonic the Hedgehog 的最高表现 AI 代理是通过调优或扩展现有算法(如 PPO 和 Rainbow DQN)开发的。

7577

OpenAI 在多智能体系统中的学习策略表征

OpenAI 引入了一种通用学习框架,将智能体建模视为表征学习问题,以在多智能体系统中使用最少的交互数据来理解智能体行为。

7578

OpenAI 通过无监督学习提升语言理解

OpenAI 证明,基于 Transformer 的模型通过无监督语言建模进行预训练,然后在小规模监督数据集上进行微调,能够在包括常识推理在内的多种语言任务上实现最先进的结果。

7579

GamePad:用于定理证明的学习环境

OpenAI 推出 GamePad,这是一套旨在在 Coq 交互式证明助理中应用机器学习方法进行定理证明的系统,可实现策略预测和位置评估的自动化。

7580

OpenAI 研究员计划 2018 秋季

OpenAI 于 2018 年秋季推出了研究员项目,为没有正式 AI 背景的个人提供进入人工智能研究的途径。

7581

OpenAI Gym Retro 发布

OpenAI 已发布 Gym Retro 的完整版本,这是一款强化学习平台,将可用游戏库扩展至 1,000 多款,覆盖多个经典游戏机,以促进对智能体泛化能力的研究。

7582

OpenAI AI 与计算分析

OpenAI 分析显示,自 2012 年以来,用于最大规模 AI 训练的计算量呈指数增长,平均每 3.4 个月翻一番,远超摩尔定律。

7583

通过辩论实现 AI 安全

OpenAI 提出了一种安全技术,通过训练 AI 代理进行辩论,以帮助人类监督执行超出人类认知能力任务的系统。

7584

OpenAI 进化策略梯度 (EPG)

OpenAI 介绍了进化策略梯度 (EPG),一种通过进化损失函数帮助强化学习代理在任务族内对新任务进行泛化的元学习方法。

7585

OpenAI 快速学习基准

OpenAI 推出了一个基于 Sonic the Hedgehog 视频游戏系列的新强化学习基准,用于衡量迁移学习和少样本学习的性能。

7586

OpenAI Retro 竞赛与 Gym Retro 发布

OpenAI 发起了 Retro 竞赛,以衡量强化学习在未见视频游戏关卡上的泛化能力,并发布了 Gym Retro——一个将 30 款 SEGA Genesis 和 62 款 Atari 2600 游戏集成到 Gym 中的平台。

7587

OpenAI 基于动作依赖因子化基线的策略梯度方差降低

OpenAI 的研究人员开发了一种无偏的动作依赖基线用于策略梯度方法,以降低梯度估计的方差,从而在高维动作空间中实现更快的学习。

7588

OpenAI OT-GAN:使用最优传输改进 GAN

OpenAI 推出最优传输 GAN(OT-GAN),这是一种使用新型小批量能量距离度量来提升训练稳定性和图像生成质量的生成对抗网络变体。

7589

OpenAI 2018年3月黑客马拉松报告

OpenAI 于 2018 年 3 月 3 日举办了首次黑客马拉松,汇聚了 100 名 AI 社区成员,开发涵盖医疗、安全和强化学习的项目。

7590

关于一阶元学习算法

OpenAI 介绍了 Reptile,这是一种一阶元学习算法,通过优化参数初始化,使代理能够在新任务上快速学习,而无需二阶导数。

7591

OpenAI Reptile:可扩展的元学习算法

OpenAI 推出了 Reptile,这是一种可扩展的元学习算法,通过最大化同一任务不同小批量梯度之间的内积,使模型能够从少量示例中实现泛化。

7592

OpenAI 学者计划

OpenAI 推出了 OpenAI 学者计划,为弱势群体的个人提供补助金和导师指导,以学习深度学习并开源项目。

7593

OpenAI 研究:通过元强化学习学习探索

OpenAI 研究人员推出了 E-MAML 和 E-RL²,这两种元强化学习算法旨在提升在复杂环境中的探索性能。

7594

OpenAI 机器人研究的要素

OpenAI 发布了八个模拟机器人环境和一个 Baselines 实现的 Hindsight Experience Replay (HER),以便在复杂的操作任务中通过稀疏奖励实现强化学习。

7595

OpenAI 多目标强化学习机器人环境

OpenAI 已发布一套具有挑战性的连续控制机器人任务,已与 OpenAI Gym 集成,以推进多目标强化学习的研究。

7596

OpenAI 2018 年 3 月黑客松

OpenAI 在 2018 年 3 月 3 日于旧金山举办了一场社区黑客松和一系列讲座,以鼓励 AI 学习和项目开发。

7597

OpenAI 支持者和组织更新

OpenAI 宣布了新捐赠者、顾问任命以及埃隆·马斯克离开其董事会,以避免与特斯拉 AI 重点可能产生的冲突。

7598

OpenAI 正在为 AI 的恶意使用做准备

OpenAI 及其合作伙伴发布了一份研究论文,预测 AI 可能被恶意行为者滥用的方式,并提供了缓解这些全球安全威胁的建议。

7599

OpenAI 通过教学实现可解释的机器学习

OpenAI 提出了一种机器教学方法,该方法使用教师-学生神经网络框架来识别概念的最具说明性的示例,确保得到的解释是人类可解释的,而不是任意的。

7600

OpenAI 发现实体消歧的类型

OpenAI 开发了一种系统,该系统使用神经网络预测自动发现的类型的成员资格,以提高 CoNLL 和 TAC KBP 2010 数据集上的实体消歧准确率。