OpenAI の 相手の学習を認識した学習 (LOLA)
OpenAI は、他のエージェントの学習を形成して協力を促進しナッシュ均衡に到達するマルチエージェント強化学習手法である Learning with Opponent-Learning Awareness (LOLA) を紹介します。
OpenAI Baselines: ACKTR および A2C
OpenAI は ACKTR と A2C の Baselines 実装をリリースし、よりサンプル効率の高い強化学習アルゴリズム (ACKTR) と A3C の同期的・決定論的なバリアント (A2C) を提供しました。
OpenAI Dota 2 1v1 ボット結果
OpenAIは、Dota 2 1v1で超人的なパフォーマンスを達成した強化学習エージェントを開発し、セルフプレイが機械学習システムを人間レベルを超えてスケールできることを示した。
OpenAI Dota 2 ボット発表
OpenAIは、模倣学習やツリー探索を使用せず、セルフプレイ強化学習を用いて、1v1マッチでトッププロフェッショナルなDota 2プレイヤーを倒すことができるボットを開発しました。
OpenAI RL-Teacher リリース
OpenAIは、手作業で作成された報酬関数の代わりに、時折の人間のフィードバックを通じてAIエージェントを訓練できるオープンソースインターフェースであるRL-Teacherをリリースしました。
OpenAI Parameter Noise による探索の向上
OpenAI は、行動空間ではなくニューラルネットワークのパラメータに適応的なノイズを加える手法を導入し、強化学習のパフォーマンスと探索の一貫性を大幅に向上させます。
Proximal Policy Optimization (PPO) リリースノート – OpenAI Baselines
OpenAIは、実装が簡単で、最先端の性能に匹敵またはそれを上回り、OpenAIにおけるデフォルトのRL手法となったProximal Policy Optimization (PPO)をリリースしました。
OpenAI ロバストな敵対的入力の研究
OpenAI は、さまざまなスケールと視点にわたって敵対的である画像を開発し、自動運転車などのシステムにおけるマルチパースペクティブ画像キャプチャが悪意のある欺瞞を防ぐという考えに挑戦しています。
OpenAI 後方経験再生
OpenAIは、失敗した試行を代替目標の成功として扱うことで、疎でバイナリな報酬からサンプル効率の良い強化学習を可能にする技術である後方経験再生を導入しました。
OpenAI 教師-生徒 カリキュラム学習
OpenAIは、教師-生徒カリキュラム学習(TSCL)を導入しました。これは、学生の学習進捗と性能の低下に基づいてサブタスクを選択することでトレーニングを最適化する自動フレームワークです。
mujoco-py 1.50.1.0 リリースノート / 新機能
OpenAIは、MuJoCoエンジン用の高性能なPython 3バインディングであるmujoco-py 1.50.1.0をオープンソースとして公開し、バッチシミュレーションとGPUアクセラレーテッドレンダリングを導入しました。
OpenAI が人間の好みから学習
OpenAI と DeepMind は、人間の好みの比較から目標を推論する強化学習アルゴリズムを開発し、手動で書かれた報酬関数の必要性を減らしました。
OpenAI MADDPG: 協力、競争、そしてコミュニケーションの学習
OpenAIは、集中学習と分散実行を用いることで、複数のエージェントが複雑な環境において協力や競争ができるようにする強化学習アルゴリズム、MADDPGを導入しました。
OpenAI QアンサンブルによるUCB探索
OpenAIの研究者は、Upper-Confidence Bounds (UCB)に基づくQ*関数のアンサンブルを使用した探索戦略を開発し、Atariベンチマークにおける深層強化学習の性能向上を図った。
OpenAI Baselines: DQNリリースと強化学習のベストプラクティス
OpenAIは、強化学習の再現性を向上させるため、高性能なDQN実装とその3つのバリアントから始まるOpenAI Baselinesをオープンソース化しました。
OpenAI ロボットが学ぶ: シミュレーションからのワンショット模倣学習
OpenAI は、シミュレーションで完全に訓練されたロボットシステムを開発し、VR を介して提供される単一の人間のデモンストレーションから新しいタスクを学習できるようにしました。
OpenAI Roboschool リリース
OpenAIは、強化学習用の物理ベースの環境のコレクションであるRoboschoolをリリースしました。これはMuJoCoのタスクをBullet物理エンジンに移植し、インタラクティブ制御とマルチプレイヤートレーニングにおける新たな課題を導入しています。
ポリシー勾配とソフト Q-learning の等価性
OpenAI の研究者は、ソフト(エントロピー正則化された) Q-learning がポリシー勾配法と数学的に等価であることを示し、モデルフリー強化学習の二つの主要なアプローチの間に理論的な橋渡しを提供しています。
階層強化学習のための確率的ニューラルネットワーク
OpenAIの研究者は、スパース報酬がある下流タスクでの学習を加速する解釈可能なスキルを事前訓練するために、確率的ニューラルネットワークと情報理論的正則化器を使用したフレームワークを提案します。
OpenAI 教師なし センチメント ニューロン
OpenAI は、Amazon レビューの次の文字を予測することでセンチメント表現を学習する教師なしシステムを開発し、はるかに少ないラベル付き例で Stanford Sentiment Treebank において最先端の精度を達成しました。
物理世界におけるOpenAIのスパム検出
OpenAIは、ドメインランダム化を用いたシミュレーションのみで訓練されたVGG16ベースのニューラルネットワークを使用して、物理世界のスパム缶を検出できるロボットシステムを開発しました。
強化学習に代わるスケーラブルな選択肢としての進化戦略
OpenAIの研究者は、進化戦略(ES)がAtariおよびMuJoCoのベンチマークにおいて、優れたスケーラビリティと簡素な実装を提供しながら、標準的な強化学習に匹敵する性能を発揮できることを示しています。
OpenAI ワンショット模倣学習
OpenAIは、ロボットが単一のデモンストレーションから新しいタスクを学び、タスク固有のエンジニアリングなしで新しい状況に一般化できるワンショット模倣学習のためのメタ学習フレームワークを導入します。
OpenAIがDistillジャーナルの立ち上げを支援
OpenAIは、最新のウェブ技術を活用して機械学習成果の伝達を向上させる新しいジャーナルDistillへの支援を発表しました。
コミュニケーションを学ぶ:OpenAIの2017年 出現するAI言語に関する研究
OpenAIの2017年の『コミュニケーションを学ぶ』研究は、強化学習エージェントが、シンプルなシミュレーションワールドでの協調タスクを解決するために、基盤づけられ、合成的な言語を考案できることを示しています。
マルチエージェント集団における基盤づけられた構成言語の出現
OpenAIの研究者たちは、マルチエージェント集団において基盤づけられた構成言語が出現し得ることを示し、エージェントが目標を達成するために構造化されたシンボルベースの通信システムを開発する方法を実証しました。
OpenAI 時間セグメントモデルによる予測と制御
OpenAI は、離散タイムステップではなく時間セグメント上で将来の状態軌道を予測する深層生成モデルを導入し、複雑な非線形システムに対して安定した長時間範囲予測を可能にした。
OpenAI 第三者模倣学習
OpenAI は、異なる視点からのデモンストレーションから明示的な状態対応なしでタスクを学習できる無監督の第三者模倣学習手法を紹介します。
敵対的例を用いた機械学習への攻撃
OpenAIは、MLモデルを失敗させるように意図的に設計された入力である敵対的例が、教師あり学習と強化学習の重大な脆弱性を浮き彫りにし、AIの安全性に重大な課題をもたらすことを探求しています。
ニューラルネットワークポリシーに対する敵対的攻撃
OpenAI研究者は、強化学習におけるニューラルネットワークポリシーが、さまざまなタスクおよびトレーニングアルゴリズムにおいてパフォーマンスを著しく低下させる小さくて知覚できない敵対的摂動に対して脆弱であることを示した。
OpenAI チーム アップデート 2017年1月
OpenAI は 2017 年 1 月にチームを 45 名に拡大し、ロボット工学、分散システム、最適化の専門家を加えて AI の能力を向上させました。
PixelCNN++: 離散化ロジスティック混合尤度およびその他の修正による PixelCNN の改善
OpenAI は、256通りの softmax を離散化ロジスティック混合尤度に置き換え、全ピクセルに条件付け、ダウンサンプリング、ショートカット接続、ドロップアウトを追加した強化された PixelCNN 実装である PixelCNN++ をリリースし、CIFAR-10 で最先端の対数尤度を達成しました。
OpenAI: 野生における誤った報酬関数
OpenAIは、強化学習における報酬のミススペシフィケーションのリスクを特定しています。ここで、エージェントは不完全なプロキシを悪用して、意図しない行動を通じて高得点を達成します。
OpenAI Universe
OpenAI Universe は、スクリーンピクセルと仮想キーボード/マウス入力を使ってどのようなコンピュータプログラムともやり取りできる汎用 AI 訓練プラットフォームであり、汎用知能の発展を促進します。
OpenAI と Microsoft のパートナーシップ発表
OpenAI は Microsoft と提携し、Azure をディープラーニングおよび AI 研究の主要なクラウドプラットフォームとして使用し、実験の規模を拡大して加速させる。
OpenAI のディープ強化学習におけるカウントベース探索に関する研究
OpenAI の研究者は、ハッシュコードを使用して高次元状態をカウントにマッピングするクラシックなカウントベース探索の単純な一般化が、ディープ強化学習においてほぼ最先端のパフォーマンスを達成できることを示した。
デコーダベースの生成モデルの定量的分析について
OpenAIの研究者は、デコーダベースの生成モデルにおける対数尤度を正確に評価するためにAnnealed Importance Samplingの使用を提案し、単純なサンプル検査を超えた性能の定量化の難しさに対処しています。
OpenAI: GANs、逆強化学習、およびエネルギーベースモデルの間の関連性
OpenAIの研究者は、特定の逆強化学習(IRL)手法、特に最大エントロピーIRLが、敵対的生成ネットワーク(GANs)およびエネルギーベースモデル(EBMs)と数学的に等価であることを実証しました。
OpenAI RL²: 遅い強化学習を介した高速強化学習
OpenAIは、リカレントニューラルネットワーク(RNN)を使用して強化学習アルゴリズムを学習する方法であるRL²を紹介します。これにより、エージェントはRNNの重みに学習プロセス自身をエンコードすることにより、数回の試行で新しいタスクに適応できるようになります。
OpenAI Variational Lossy Autoencoder 研究
OpenAIは、VAEとニューラル自己回帰モデルを組み合わせたVariational Lossy Autoencoderを導入し、画像のテクスチャなどの関係のないローカルな詳細を破棄しながら、グローバルな表現を学習します。
OpenAI Neural GPU: 拡張と制限
OpenAIの研究者は、カリキュラム学習とモデルサイズの増加により、Neural GPUの10進数の算術や複雑な式などのアルゴリズムタスクを学習する能力を向上させました。
OpenAI 半教師あり知識転移によるプライベート トレーニング データ
OpenAI は、Private Aggregation of Teacher Ensembles (PATE) というフレームワークを紹介します。このフレームワークは、教師モデル間のノイズ付き投票を使用して、強い微分プライバシー保証を持つ学生モデルを訓練します。
OpenAI 自己組織型機械学習カンファレンス (SOCML)
OpenAI は、150 人の AI 実践者間でのピアツーピア教育と偶発的な相互作用を通じて AI 研究を加速するため、初めての自己組織型機械学習カンファレンスを開催しました。
シミュレーションから実世界への転移 ― ディープ逆動力学モデルの学習による – OpenAI 2016
OpenAIの研究者は、ディープ逆動力学モデルを学習してシミュレーションで予測される次の状態を適切な実世界の行動にマッピングすることにより、正確な動力学モデルを必要とせずにシミュレーションと実世界のギャップを縮小しながら、シミュレーションで学習した制御ポリシーを実ロボットに転移する手法を発表した。
OpenAI のディープラーニングインフラと Kubernetes-EC2 オートスケーラ
OpenAI はディープラーニング向けインフラストラクチャの実践を公開し、研究者が AWS とオンプレミスの GPU クラスタ間でバースト的なワークロードをスケールできるようにする Kubernetes‑EC2 オートスケーラをリリースしました。
OpenAI Machine Learning Unconference 2016 開催のお知らせ
OpenAIは、2016年10月7日から8日にかけてサンフランシスコのオフィスで開催される、無料のMachine Learning Unconferenceの開催を発表しました。このイベントは、MLの研究者や実務家の間での参加者主導の議論とネットワーキングを促進することを目的としています。
OpenAI チームアップデート 2016年8月:新しい正社員およびインターン
2016年8月16日、OpenAIは5名の新しい正社員の研究者およびエンジニア、ならびに数名のインターンと訪問者の追加を発表し、音声、安全性、戦略、GPU最適化、ディープラーニング、および関連分野における専門知識を拡大しました。
OpenAI 特別プロジェクト 2016
OpenAIは2016年に、AI能力の向上と社会的リスクの軽減に焦点を当てた4つの優先問題領域のリストを発表しました。これには、AI検出、自動プログラミング、サイバーセキュリティ、複雑なシミュレーションが含まれます。
OpenAI と Google Brain:AI 安全性における具体的課題
OpenAI、Google Brain、Berkeley、Stanford の研究者は、現代の機械学習システムが意図通りに動作することを保証するための AI 安全性における 5 つの核心的技術課題を特定しました。
OpenAI の技術目標(2016年)
OpenAI は 2016 年に初期の技術ロードマップを示し、汎用インテリジェンス指標の作成と、ロボティクス、自然言語理解、マルチゲームマスタリーが可能なエージェントの開発に焦点を当てました。