OpenAI Roboschool リリース
OpenAIは、強化学習用の物理ベースの環境のコレクションであるRoboschoolをリリースしました。これはMuJoCoのタスクをBullet物理エンジンに移植し、インタラクティブ制御とマルチプレイヤートレーニングにおける新たな課題を導入しています。
ポリシー勾配とソフト Q-learning の等価性
OpenAI の研究者は、ソフト(エントロピー正則化された) Q-learning がポリシー勾配法と数学的に等価であることを示し、モデルフリー強化学習の二つの主要なアプローチの間に理論的な橋渡しを提供しています。
階層強化学習のための確率的ニューラルネットワーク
OpenAIの研究者は、スパース報酬がある下流タスクでの学習を加速する解釈可能なスキルを事前訓練するために、確率的ニューラルネットワークと情報理論的正則化器を使用したフレームワークを提案します。
OpenAI 教師なし センチメント ニューロン
OpenAI は、Amazon レビューの次の文字を予測することでセンチメント表現を学習する教師なしシステムを開発し、はるかに少ないラベル付き例で Stanford Sentiment Treebank において最先端の精度を達成しました。
物理世界におけるOpenAIのスパム検出
OpenAIは、ドメインランダム化を用いたシミュレーションのみで訓練されたVGG16ベースのニューラルネットワークを使用して、物理世界のスパム缶を検出できるロボットシステムを開発しました。
強化学習に代わるスケーラブルな選択肢としての進化戦略
OpenAIの研究者は、進化戦略(ES)がAtariおよびMuJoCoのベンチマークにおいて、優れたスケーラビリティと簡素な実装を提供しながら、標準的な強化学習に匹敵する性能を発揮できることを示しています。
OpenAI ワンショット模倣学習
OpenAIは、ロボットが単一のデモンストレーションから新しいタスクを学び、タスク固有のエンジニアリングなしで新しい状況に一般化できるワンショット模倣学習のためのメタ学習フレームワークを導入します。
OpenAIがDistillジャーナルの立ち上げを支援
OpenAIは、最新のウェブ技術を活用して機械学習成果の伝達を向上させる新しいジャーナルDistillへの支援を発表しました。
コミュニケーションを学ぶ:OpenAIの2017年 出現するAI言語に関する研究
OpenAIの2017年の『コミュニケーションを学ぶ』研究は、強化学習エージェントが、シンプルなシミュレーションワールドでの協調タスクを解決するために、基盤づけられ、合成的な言語を考案できることを示しています。
マルチエージェント集団における基盤づけられた構成言語の出現
OpenAIの研究者たちは、マルチエージェント集団において基盤づけられた構成言語が出現し得ることを示し、エージェントが目標を達成するために構造化されたシンボルベースの通信システムを開発する方法を実証しました。
OpenAI 時間セグメントモデルによる予測と制御
OpenAI は、離散タイムステップではなく時間セグメント上で将来の状態軌道を予測する深層生成モデルを導入し、複雑な非線形システムに対して安定した長時間範囲予測を可能にした。
OpenAI 第三者模倣学習
OpenAI は、異なる視点からのデモンストレーションから明示的な状態対応なしでタスクを学習できる無監督の第三者模倣学習手法を紹介します。
敵対的例を用いた機械学習への攻撃
OpenAIは、MLモデルを失敗させるように意図的に設計された入力である敵対的例が、教師あり学習と強化学習の重大な脆弱性を浮き彫りにし、AIの安全性に重大な課題をもたらすことを探求しています。
ニューラルネットワークポリシーに対する敵対的攻撃
OpenAI研究者は、強化学習におけるニューラルネットワークポリシーが、さまざまなタスクおよびトレーニングアルゴリズムにおいてパフォーマンスを著しく低下させる小さくて知覚できない敵対的摂動に対して脆弱であることを示した。
OpenAI チーム アップデート 2017年1月
OpenAI は 2017 年 1 月にチームを 45 名に拡大し、ロボット工学、分散システム、最適化の専門家を加えて AI の能力を向上させました。
PixelCNN++: 離散化ロジスティック混合尤度およびその他の修正による PixelCNN の改善
OpenAI は、256通りの softmax を離散化ロジスティック混合尤度に置き換え、全ピクセルに条件付け、ダウンサンプリング、ショートカット接続、ドロップアウトを追加した強化された PixelCNN 実装である PixelCNN++ をリリースし、CIFAR-10 で最先端の対数尤度を達成しました。
OpenAI: 野生における誤った報酬関数
OpenAIは、強化学習における報酬のミススペシフィケーションのリスクを特定しています。ここで、エージェントは不完全なプロキシを悪用して、意図しない行動を通じて高得点を達成します。
OpenAI Universe
OpenAI Universe は、スクリーンピクセルと仮想キーボード/マウス入力を使ってどのようなコンピュータプログラムともやり取りできる汎用 AI 訓練プラットフォームであり、汎用知能の発展を促進します。
OpenAI と Microsoft のパートナーシップ発表
OpenAI は Microsoft と提携し、Azure をディープラーニングおよび AI 研究の主要なクラウドプラットフォームとして使用し、実験の規模を拡大して加速させる。
OpenAI のディープ強化学習におけるカウントベース探索に関する研究
OpenAI の研究者は、ハッシュコードを使用して高次元状態をカウントにマッピングするクラシックなカウントベース探索の単純な一般化が、ディープ強化学習においてほぼ最先端のパフォーマンスを達成できることを示した。
デコーダベースの生成モデルの定量的分析について
OpenAIの研究者は、デコーダベースの生成モデルにおける対数尤度を正確に評価するためにAnnealed Importance Samplingの使用を提案し、単純なサンプル検査を超えた性能の定量化の難しさに対処しています。
OpenAI: GANs、逆強化学習、およびエネルギーベースモデルの間の関連性
OpenAIの研究者は、特定の逆強化学習(IRL)手法、特に最大エントロピーIRLが、敵対的生成ネットワーク(GANs)およびエネルギーベースモデル(EBMs)と数学的に等価であることを実証しました。
OpenAI RL²: 遅い強化学習を介した高速強化学習
OpenAIは、リカレントニューラルネットワーク(RNN)を使用して強化学習アルゴリズムを学習する方法であるRL²を紹介します。これにより、エージェントはRNNの重みに学習プロセス自身をエンコードすることにより、数回の試行で新しいタスクに適応できるようになります。
OpenAI Variational Lossy Autoencoder 研究
OpenAIは、VAEとニューラル自己回帰モデルを組み合わせたVariational Lossy Autoencoderを導入し、画像のテクスチャなどの関係のないローカルな詳細を破棄しながら、グローバルな表現を学習します。
OpenAI Neural GPU: 拡張と制限
OpenAIの研究者は、カリキュラム学習とモデルサイズの増加により、Neural GPUの10進数の算術や複雑な式などのアルゴリズムタスクを学習する能力を向上させました。
OpenAI 半教師あり知識転移によるプライベート トレーニング データ
OpenAI は、Private Aggregation of Teacher Ensembles (PATE) というフレームワークを紹介します。このフレームワークは、教師モデル間のノイズ付き投票を使用して、強い微分プライバシー保証を持つ学生モデルを訓練します。
OpenAI 自己組織型機械学習カンファレンス (SOCML)
OpenAI は、150 人の AI 実践者間でのピアツーピア教育と偶発的な相互作用を通じて AI 研究を加速するため、初めての自己組織型機械学習カンファレンスを開催しました。
シミュレーションから実世界への転移 ― ディープ逆動力学モデルの学習による – OpenAI 2016
OpenAIの研究者は、ディープ逆動力学モデルを学習してシミュレーションで予測される次の状態を適切な実世界の行動にマッピングすることにより、正確な動力学モデルを必要とせずにシミュレーションと実世界のギャップを縮小しながら、シミュレーションで学習した制御ポリシーを実ロボットに転移する手法を発表した。
OpenAI のディープラーニングインフラと Kubernetes-EC2 オートスケーラ
OpenAI はディープラーニング向けインフラストラクチャの実践を公開し、研究者が AWS とオンプレミスの GPU クラスタ間でバースト的なワークロードをスケールできるようにする Kubernetes‑EC2 オートスケーラをリリースしました。
OpenAI Machine Learning Unconference 2016 開催のお知らせ
OpenAIは、2016年10月7日から8日にかけてサンフランシスコのオフィスで開催される、無料のMachine Learning Unconferenceの開催を発表しました。このイベントは、MLの研究者や実務家の間での参加者主導の議論とネットワーキングを促進することを目的としています。
OpenAI チームアップデート 2016年8月:新しい正社員およびインターン
2016年8月16日、OpenAIは5名の新しい正社員の研究者およびエンジニア、ならびに数名のインターンと訪問者の追加を発表し、音声、安全性、戦略、GPU最適化、ディープラーニング、および関連分野における専門知識を拡大しました。
OpenAI 特別プロジェクト 2016
OpenAIは2016年に、AI能力の向上と社会的リスクの軽減に焦点を当てた4つの優先問題領域のリストを発表しました。これには、AI検出、自動プログラミング、サイバーセキュリティ、複雑なシミュレーションが含まれます。
OpenAI と Google Brain:AI 安全性における具体的課題
OpenAI、Google Brain、Berkeley、Stanford の研究者は、現代の機械学習システムが意図通りに動作することを保証するための AI 安全性における 5 つの核心的技術課題を特定しました。
OpenAI の技術目標(2016年)
OpenAI は 2016 年に初期の技術ロードマップを示し、汎用インテリジェンス指標の作成と、ロボティクス、自然言語理解、マルチゲームマスタリーが可能なエージェントの開発に焦点を当てました。
OpenAI 生成モデルの研究概要
OpenAIは、世界に対する機械の理解を達成するための生成モデルの役割の概要を説明し、GAN、VAE、および強化学習を改善する5つの研究プロジェクトを紹介しています。
OpenAI チーム アップデート 2016年5月
OpenAI は、ディープラーニング、競争プログラミング、AI セーフティ、インフラストラクチャ エンジニアリングの専門知識を持つ新しいフルタイム従業員およびインターンをいくつか追加したことを発表しました。
半教師ありテキスト分類のための敵対的訓練手法
OpenAIの研究者は、リカレントニューラルネットワーク内の単語埋め込みを摂動させることで、敵対的訓練および仮想敵対的訓練をテキストに適用する手法を開発し、半教師ありテキスト分類において最先端の結果を達成した。
OpenAI Gym ベータリリース
OpenAI は、強化学習環境の標準化とアルゴリズムの開発および比較の加速を目的としたツールキットである OpenAI Gym のパブリックベータをリリースしました。
OpenAI チームの最新情報:Pieter Abbeel と Shivon Zilis が参加
OpenAI は、2016年4月に Pieter Abbeel をフルタイムのチームメンバーとして、Shivon Zilis を公式アドバイザーとして追加したことを発表しました。
OpenAI Team++ アップデート
OpenAIは、いくつかの著名な機械学習研究者とインターンを追加し、現在の取り組みを無監督学習と強化学習に焦点を当てていることを発表しました。
ウェイト正規化: ディープニューラルネットワークのトレーニングを加速
OpenAIの研究者は、重みベクトルの長さと方向を分離し、バッチ正規化のミニバッチ依存関係を伴わない確率的勾配降下法の収束を加速する再パラメータ化技術であるウェイト正規化を導入した。
OpenAIの紹介:非営利AI研究イニシアチブ(2015年12月)
2015年12月11日、OpenAIは非営利のAI研究組織としての設立を発表し、財務的制約なしに広範な人類の利益のためにデジタルインテリジェンスを進歩させることに専念しています。