1001

OpenAI Gotta Learn Fast ベンチマーク

OpenAIは、Sonic the Hedgehogのビデオゲームフランチャイズを基にした新しい強化学習ベンチマークを導入し、転移学習と少数ショット学習の性能を測定します。

1002

OpenAI Retro コンテストと Gym Retro のリリース

OpenAI は、未見のビデオゲームレベルに対する強化学習の汎化を測定する Retro コンテストを開始し、30 本の SEGA Genesis と 62 本の Atari 2600 ゲームを Gym に統合したプラットフォームである Gym Retro をリリースしました。

1003

OpenAI のアクション依存因子分解ベースラインによるポリシー勾配の分散削減

OpenAI の研究者は、勾配推定の分散を低減し、高次元アクション空間での学習を高速化するバイアスフリーなアクション依存ベースラインをポリシー勾配法向けに開発しました。

1004

OpenAI OT-GAN: 最適輸送を用いたGANの改善

OpenAIは、トレーニングの安定性と画像生成品質を向上させる新しいミニバッチエネルギー距離指標を使用した、生成的敵対ネットワークのバリアントであるOptimal Transport GAN(OT-GAN)を紹介します。

1005

OpenAIハッカソンレポート 2018年3月

OpenAIは2018年3月3日に初めてのハッカソンを開催し、AIコミュニティのメンバー100名がヘルスケア、AI安全性、強化学習にまたがるプロジェクトを開発しました。

1006

一次階メタラーニングアルゴリズムについて

OpenAIは、二階微分を必要とせずにパラメータ初期化を最適化することで、エージェントが新しいタスクを迅速に学習できる一次階メタラーニングアルゴリズム「Reptile」を紹介します。

1007

OpenAI Reptile: スケーラブルなメタラーニングアルゴリズム

OpenAI は Reptile を導入しました。これはスケーラブルなメタラーニングアルゴリズムで、同一タスク内の異なるミニバッチの勾配間の内積を最大化することで、モデルが少数の例から一般化できるようにします。

1008

OpenAI スカラーズプログラム

OpenAIは、過小代表グループの個人に対し、ディープラーニングを学びプロジェクトをオープンソース化するための奨学金とメンターシップを提供するOpenAI Scholarsプログラムを開始しました。

1009

OpenAI研究:メタ強化学習による探索の学習

OpenAIの研究者は、複雑な環境における探索性能を向上させることを目的とした2つのメタ強化学習アルゴリズム、E-MAMLとE-RL²を導入しました。

1010

OpenAI ロボティクス研究のための材料

OpenAI は、複雑な操作タスクにおけるスパース報酬からの強化学習を可能にするため、8 つのシミュレートされたロボティクス環境と Baselines の Hindsight Experience Replay (HER) 実装をリリースしました。

1011

OpenAI マルチゴール強化学習ロボティクス環境

OpenAI は、OpenAI Gym と統合された挑戦的な連続制御ロボットタスクのスイートをリリースし、マルチゴール強化学習の研究を推進しました。

1012

OpenAI ハッカソン 2018年3月

OpenAIは2018年3月3日にサンフランシスコでコミュニティハッカソンと一連のトークを開催し、AIの学習とプロジェクト開発を促進しました。

1013

OpenAI サポーターと組織のアップデート

OpenAIは、新しいドナー、アドバイザーの任命、そしてテスラのAI焦点との潜在的な利益相反を避けるためにイーロン・マスクが取締役会を離れたことを発表しました。

1014

OpenAI の悪意ある AI 利用への備え

OpenAI とパートナーは、悪意ある行為者による AI の悪用を予測し、これらのグローバルな安全保障脅威を緩和するための提言をまとめた研究論文を発表しました。

1015

OpenAI 教えることによる解釈可能な機械学習

OpenAI は、教師-生徒ニューラルネットワークフレームワークを使用して概念の最も示唆的な例を特定し、その結果の解釈が任意ではなく人間に解釈可能であることを保証する機械教授アプローチを導入します。

1016

OpenAIによるエンティティ曖昧さ回避のためのタイプの発見

OpenAIは、CoNLLおよびTAC KBP 2010データセットにおけるエンティティ曖昧さ回避の精度を向上させるために、ニューラルネットワークを使用して自動的に発見されたタイプへの所属を予測するシステムを開発しました。

1017

OpenAI リサーチのためのリクエスト 2.0

OpenAI は、コミュニティの貢献を促すために、強化学習と機械学習における未解決の技術的問題 7 つのコレクションである Requests for Research 2.0 をリリースしました。

1018

Kubernetesを2,500ノードにスケーリング

OpenAIは、ディープラーニング研究のためにAzure上でKubernetesクラスターを2,500ノードにスケーリングするために必要な技術的最適化について説明しており、etcd、ネットワーク、イメージプルのボトルネックに対処しています。

1019

OpenAI ブロック疎 GPU カーネル

OpenAI は、ブロック疎ニューラルネットワークアーキテクチャ向けの高度に最適化された GPU カーネルをリリースし、モデルをより幅広くかつ深くしながら、cuBLAS または cuSPARSE よりも桁違いに高速に動作させることを可能にしました。

1020

OpenAIがL0正則化を通じてスパースニューラルネットワークを学習

OpenAIは、確率的ゲートを使用して重みを正確にゼロにすることで、L0ノルム正則化によるスパースモデルを作成し、訓練速度、推論速度、そして汎化性能を向上させる手法を導入しました。

1021

OpenAI 解釈可能かつ教育的な例の研究

OpenAIの研究者たちは、教師と学生のニューラルネットワークを共同ではなく反復的に訓練することで、AIと人間の両方に効果的に教えることができる解釈可能な教学戦略が生成されることを示しています。

1022

OpenAI の階層学習リサーチ

OpenAI は、複雑で長時間的なタスクを総当たり法よりも効率的に解決するために、高レベルのアクションを自動的に発見する強化学習アルゴリズムである Meta-Learning Shared Hierarchies (MLSH) を開発しました。

1023

OpenAI シミュレーションからの一般化

OpenAIは、ダイナミクスとドメインランダマイズを使用して、シミュレーションでロボットコントローラーを訓練する技術を開発しました。これにより、物理ロボットに一般化し、予期しない環境変化に反応できるようになります。

1024

OpenAI ダイナミクス ランダマイズ を用いた ロボット制御 の Sim-to-Real 転移

OpenAI の研究者は、シミュレーションでのみ訓練されたロボット制御ポリシーが、追加の物理トレーニングなしで実世界のハードウェアに転移できるダイナミクス ランダマイズ 法を開発しました。

1025

OpenAI の画像ベースロボット学習向け非対称アクタークリティック

OpenAI は、クリティックをシミュレータの完全状態で訓練し、アクターは RGBD 画像のみを使用する非対称アクタークリティックフレームワークを導入し、実世界データを使用せずに効率的なシミュレーションから実世界への転送を可能にします。

1026

OpenAI ドメインランダム化と生成モデルによるロボットの把持

OpenAIは、ドメインランダム化と自己回帰モデルを使用したデータ生成パイプラインを開発し、シミュレーションのみのトレーニングデータで未見のオブジェクトに対して実世界での把持成功率80%を達成しました。

1027

OpenAI メタラーニング レスリング向け

OpenAI は、メタラーニング エージェントがシミュレートされたロボットレスリングにおいて、より強固な固定ポリシー エージェントに打ち勝つために戦術を素早く適応させ、物理的な故障から回復できることを示した。

1028

OpenAI 競争的セルフプレイ研究

OpenAI は、競争的セルフプレイにより、シミュレートされた 3D ロボットがタックルやダイビングなどの複雑な身体スキルを人間の明示的な設計なしに自律的に発見できることを示した。

1029

ディープラインネットワークにおける非線形計算

OpenAIの研究者たちは、ゼロ周辺の浮動小数点演算のアンダーフローを利用することで、ディープラインネットワークが非線形計算を行えることを発見した。

1030

OpenAIとOxfordがマルチエージェント強化学習のためのLOLAを紹介

OpenAIとオックスフォード大学は、他のエージェントの学習を形作って相互に有益な結果を達成するRLエージェントであるLearning with Opponent-Learning Awareness (LOLA)を開発しました。

1031

OpenAI の 相手の学習を認識した学習 (LOLA)

OpenAI は、他のエージェントの学習を形成して協力を促進しナッシュ均衡に到達するマルチエージェント強化学習手法である Learning with Opponent-Learning Awareness (LOLA) を紹介します。

1032

OpenAI Baselines: ACKTR および A2C

OpenAI は ACKTR と A2C の Baselines 実装をリリースし、よりサンプル効率の高い強化学習アルゴリズム (ACKTR) と A3C の同期的・決定論的なバリアント (A2C) を提供しました。

1033

OpenAI Dota 2 1v1 ボット結果

OpenAIは、Dota 2 1v1で超人的なパフォーマンスを達成した強化学習エージェントを開発し、セルフプレイが機械学習システムを人間レベルを超えてスケールできることを示した。

1034

OpenAI Dota 2 ボット発表

OpenAIは、模倣学習やツリー探索を使用せず、セルフプレイ強化学習を用いて、1v1マッチでトッププロフェッショナルなDota 2プレイヤーを倒すことができるボットを開発しました。

1035

OpenAI RL-Teacher リリース

OpenAIは、手作業で作成された報酬関数の代わりに、時折の人間のフィードバックを通じてAIエージェントを訓練できるオープンソースインターフェースであるRL-Teacherをリリースしました。

1036

パラメータノイズによる探索の向上

OpenAIによる2017年の研究は、強化学習のポリシーに適応的なパラメータノイズを加えることで、HalfCheetahやAtari/Mujocoのベンチマークで示されたように、探索が改善され、より高いスコアが得られることを示しています。

1037

Proximal Policy Optimization (PPO) リリースノート – OpenAI Baselines

OpenAIは、実装が簡単で、最先端の性能に匹敵またはそれを上回り、OpenAIにおけるデフォルトのRL手法となったProximal Policy Optimization (PPO)をリリースしました。

1038

OpenAI ロバストな敵対的入力の研究

OpenAI は、さまざまなスケールと視点にわたって敵対的である画像を開発し、自動運転車などのシステムにおけるマルチパースペクティブ画像キャプチャが悪意のある欺瞞を防ぐという考えに挑戦しています。

1039

OpenAI 後方経験再生

OpenAIは、失敗した試行を代替目標の成功として扱うことで、疎でバイナリな報酬からサンプル効率の良い強化学習を可能にする技術である後方経験再生を導入しました。

1040

OpenAI 教師-生徒 カリキュラム学習

OpenAIは、教師-生徒カリキュラム学習(TSCL)を導入しました。これは、学生の学習進捗と性能の低下に基づいてサブタスクを選択することでトレーニングを最適化する自動フレームワークです。

1041

mujoco-py 1.50.1.0 リリースノート / 新機能

OpenAIは、MuJoCoエンジン用の高性能なPython 3バインディングであるmujoco-py 1.50.1.0をオープンソースとして公開し、バッチシミュレーションとGPUアクセラレーテッドレンダリングを導入しました。

1042

OpenAI が人間の好みから学習

OpenAI と DeepMind は、人間の好みの比較から目標を推論する強化学習アルゴリズムを開発し、手動で書かれた報酬関数の必要性を減らしました。

1043

協力し、競争し、コミュニケーションを学ぶ – OpenAI 2017 研究発表

OpenAI は 2017 年 6 月、中央集権型クリティックを持つマルチエージェント RL アルゴリズム MADDPG を発表し、共有環境においてエージェントが協力、競争、コミュニケーションを学べるようにした。

1044

OpenAI QアンサンブルによるUCB探索

OpenAIの研究者は、Upper-Confidence Bounds (UCB)に基づくQ*関数のアンサンブルを使用した探索戦略を開発し、Atariベンチマークにおける深層強化学習の性能向上を図った。

1045

OpenAI Baselines: DQNリリースと強化学習のベストプラクティス

OpenAIは、強化学習の再現性を向上させるため、高性能なDQN実装とその3つのバリアントから始まるOpenAI Baselinesをオープンソース化しました。

1046

OpenAI ロボットが学ぶ: シミュレーションからのワンショット模倣学習

OpenAI は、シミュレーションで完全に訓練されたロボットシステムを開発し、VR を介して提供される単一の人間のデモンストレーションから新しいタスクを学習できるようにしました。

1047

OpenAI Roboschool リリース

OpenAIは、強化学習用の物理ベースの環境のコレクションであるRoboschoolをリリースしました。これはMuJoCoのタスクをBullet物理エンジンに移植し、インタラクティブ制御とマルチプレイヤートレーニングにおける新たな課題を導入しています。

1048

ポリシー勾配とソフト Q-learning の等価性

OpenAI の研究者は、ソフト(エントロピー正則化された) Q-learning がポリシー勾配法と数学的に等価であることを示し、モデルフリー強化学習の二つの主要なアプローチの間に理論的な橋渡しを提供しています。

1049

階層強化学習のための確率的ニューラルネットワーク

OpenAIの研究者は、スパース報酬がある下流タスクでの学習を加速する解釈可能なスキルを事前訓練するために、確率的ニューラルネットワークと情報理論的正則化器を使用したフレームワークを提案します。

1050

OpenAI 教師なし センチメント ニューロン

OpenAI は、Amazon レビューの次の文字を予測することでセンチメント表現を学習する教師なしシステムを開発し、はるかに少ないラベル付き例で Stanford Sentiment Treebank において最先端の精度を達成しました。