7601

OpenAI の 相手の学習を認識した学習 (LOLA)

OpenAI は、他のエージェントの学習を形成して協力を促進しナッシュ均衡に到達するマルチエージェント強化学習手法である Learning with Opponent-Learning Awareness (LOLA) を紹介します。

7602

OpenAI Baselines: ACKTR および A2C

OpenAI は ACKTR と A2C の Baselines 実装をリリースし、よりサンプル効率の高い強化学習アルゴリズム (ACKTR) と A3C の同期的・決定論的なバリアント (A2C) を提供しました。

7603

OpenAI Dota 2 1v1 ボット結果

OpenAIは、Dota 2 1v1で超人的なパフォーマンスを達成した強化学習エージェントを開発し、セルフプレイが機械学習システムを人間レベルを超えてスケールできることを示した。

7604

OpenAI Dota 2 ボット発表

OpenAIは、模倣学習やツリー探索を使用せず、セルフプレイ強化学習を用いて、1v1マッチでトッププロフェッショナルなDota 2プレイヤーを倒すことができるボットを開発しました。

7605

OpenAI RL-Teacher リリース

OpenAIは、手作業で作成された報酬関数の代わりに、時折の人間のフィードバックを通じてAIエージェントを訓練できるオープンソースインターフェースであるRL-Teacherをリリースしました。

7606

OpenAI Parameter Noise による探索の向上

OpenAI は、行動空間ではなくニューラルネットワークのパラメータに適応的なノイズを加える手法を導入し、強化学習のパフォーマンスと探索の一貫性を大幅に向上させます。

7607

Proximal Policy Optimization (PPO) リリースノート – OpenAI Baselines

OpenAIは、実装が簡単で、最先端の性能に匹敵またはそれを上回り、OpenAIにおけるデフォルトのRL手法となったProximal Policy Optimization (PPO)をリリースしました。

7608

OpenAI ロバストな敵対的入力の研究

OpenAI は、さまざまなスケールと視点にわたって敵対的である画像を開発し、自動運転車などのシステムにおけるマルチパースペクティブ画像キャプチャが悪意のある欺瞞を防ぐという考えに挑戦しています。

7609

OpenAI 後方経験再生

OpenAIは、失敗した試行を代替目標の成功として扱うことで、疎でバイナリな報酬からサンプル効率の良い強化学習を可能にする技術である後方経験再生を導入しました。

7610

OpenAI 教師-生徒 カリキュラム学習

OpenAIは、教師-生徒カリキュラム学習(TSCL)を導入しました。これは、学生の学習進捗と性能の低下に基づいてサブタスクを選択することでトレーニングを最適化する自動フレームワークです。

7611

mujoco-py 1.50.1.0 リリースノート / 新機能

OpenAIは、MuJoCoエンジン用の高性能なPython 3バインディングであるmujoco-py 1.50.1.0をオープンソースとして公開し、バッチシミュレーションとGPUアクセラレーテッドレンダリングを導入しました。

7612

OpenAI が人間の好みから学習

OpenAI と DeepMind は、人間の好みの比較から目標を推論する強化学習アルゴリズムを開発し、手動で書かれた報酬関数の必要性を減らしました。

7613

OpenAI MADDPG: 協力、競争、そしてコミュニケーションの学習

OpenAIは、集中学習と分散実行を用いることで、複数のエージェントが複雑な環境において協力や競争ができるようにする強化学習アルゴリズム、MADDPGを導入しました。

7614

OpenAI QアンサンブルによるUCB探索

OpenAIの研究者は、Upper-Confidence Bounds (UCB)に基づくQ*関数のアンサンブルを使用した探索戦略を開発し、Atariベンチマークにおける深層強化学習の性能向上を図った。

7615

OpenAI Baselines: DQNリリースと強化学習のベストプラクティス

OpenAIは、強化学習の再現性を向上させるため、高性能なDQN実装とその3つのバリアントから始まるOpenAI Baselinesをオープンソース化しました。

7616

OpenAI ロボットが学ぶ: シミュレーションからのワンショット模倣学習

OpenAI は、シミュレーションで完全に訓練されたロボットシステムを開発し、VR を介して提供される単一の人間のデモンストレーションから新しいタスクを学習できるようにしました。

7617

OpenAI Roboschool リリース

OpenAIは、強化学習用の物理ベースの環境のコレクションであるRoboschoolをリリースしました。これはMuJoCoのタスクをBullet物理エンジンに移植し、インタラクティブ制御とマルチプレイヤートレーニングにおける新たな課題を導入しています。

7618

ポリシー勾配とソフト Q-learning の等価性

OpenAI の研究者は、ソフト(エントロピー正則化された) Q-learning がポリシー勾配法と数学的に等価であることを示し、モデルフリー強化学習の二つの主要なアプローチの間に理論的な橋渡しを提供しています。

7619

階層強化学習のための確率的ニューラルネットワーク

OpenAIの研究者は、スパース報酬がある下流タスクでの学習を加速する解釈可能なスキルを事前訓練するために、確率的ニューラルネットワークと情報理論的正則化器を使用したフレームワークを提案します。

7620

OpenAI 教師なし センチメント ニューロン

OpenAI は、Amazon レビューの次の文字を予測することでセンチメント表現を学習する教師なしシステムを開発し、はるかに少ないラベル付き例で Stanford Sentiment Treebank において最先端の精度を達成しました。

7621

物理世界におけるOpenAIのスパム検出

OpenAIは、ドメインランダム化を用いたシミュレーションのみで訓練されたVGG16ベースのニューラルネットワークを使用して、物理世界のスパム缶を検出できるロボットシステムを開発しました。

7622

強化学習に代わるスケーラブルな選択肢としての進化戦略

OpenAIの研究者は、進化戦略(ES)がAtariおよびMuJoCoのベンチマークにおいて、優れたスケーラビリティと簡素な実装を提供しながら、標準的な強化学習に匹敵する性能を発揮できることを示しています。

7623

OpenAI ワンショット模倣学習

OpenAIは、ロボットが単一のデモンストレーションから新しいタスクを学び、タスク固有のエンジニアリングなしで新しい状況に一般化できるワンショット模倣学習のためのメタ学習フレームワークを導入します。

7624

OpenAIがDistillジャーナルの立ち上げを支援

OpenAIは、最新のウェブ技術を活用して機械学習成果の伝達を向上させる新しいジャーナルDistillへの支援を発表しました。

7625

コミュニケーションを学ぶ:OpenAIの2017年 出現するAI言語に関する研究

OpenAIの2017年の『コミュニケーションを学ぶ』研究は、強化学習エージェントが、シンプルなシミュレーションワールドでの協調タスクを解決するために、基盤づけられ、合成的な言語を考案できることを示しています。

7626

マルチエージェント集団における基盤づけられた構成言語の出現

OpenAIの研究者たちは、マルチエージェント集団において基盤づけられた構成言語が出現し得ることを示し、エージェントが目標を達成するために構造化されたシンボルベースの通信システムを開発する方法を実証しました。

7627

OpenAI 時間セグメントモデルによる予測と制御

OpenAI は、離散タイムステップではなく時間セグメント上で将来の状態軌道を予測する深層生成モデルを導入し、複雑な非線形システムに対して安定した長時間範囲予測を可能にした。

7628

OpenAI 第三者模倣学習

OpenAI は、異なる視点からのデモンストレーションから明示的な状態対応なしでタスクを学習できる無監督の第三者模倣学習手法を紹介します。

7629

敵対的例を用いた機械学習への攻撃

OpenAIは、MLモデルを失敗させるように意図的に設計された入力である敵対的例が、教師あり学習と強化学習の重大な脆弱性を浮き彫りにし、AIの安全性に重大な課題をもたらすことを探求しています。

7630

ニューラルネットワークポリシーに対する敵対的攻撃

OpenAI研究者は、強化学習におけるニューラルネットワークポリシーが、さまざまなタスクおよびトレーニングアルゴリズムにおいてパフォーマンスを著しく低下させる小さくて知覚できない敵対的摂動に対して脆弱であることを示した。

7631

OpenAI チーム アップデート 2017年1月

OpenAI は 2017 年 1 月にチームを 45 名に拡大し、ロボット工学、分散システム、最適化の専門家を加えて AI の能力を向上させました。

7632

PixelCNN++: 離散化ロジスティック混合尤度およびその他の修正による PixelCNN の改善

OpenAI は、256通りの softmax を離散化ロジスティック混合尤度に置き換え、全ピクセルに条件付け、ダウンサンプリング、ショートカット接続、ドロップアウトを追加した強化された PixelCNN 実装である PixelCNN++ をリリースし、CIFAR-10 で最先端の対数尤度を達成しました。

7633

OpenAI: 野生における誤った報酬関数

OpenAIは、強化学習における報酬のミススペシフィケーションのリスクを特定しています。ここで、エージェントは不完全なプロキシを悪用して、意図しない行動を通じて高得点を達成します。

7634

OpenAI Universe

OpenAI Universe は、スクリーンピクセルと仮想キーボード/マウス入力を使ってどのようなコンピュータプログラムともやり取りできる汎用 AI 訓練プラットフォームであり、汎用知能の発展を促進します。

7635

OpenAI と Microsoft のパートナーシップ発表

OpenAI は Microsoft と提携し、Azure をディープラーニングおよび AI 研究の主要なクラウドプラットフォームとして使用し、実験の規模を拡大して加速させる。

7636

OpenAI のディープ強化学習におけるカウントベース探索に関する研究

OpenAI の研究者は、ハッシュコードを使用して高次元状態をカウントにマッピングするクラシックなカウントベース探索の単純な一般化が、ディープ強化学習においてほぼ最先端のパフォーマンスを達成できることを示した。

7637

デコーダベースの生成モデルの定量的分析について

OpenAIの研究者は、デコーダベースの生成モデルにおける対数尤度を正確に評価するためにAnnealed Importance Samplingの使用を提案し、単純なサンプル検査を超えた性能の定量化の難しさに対処しています。

7638

OpenAI: GANs、逆強化学習、およびエネルギーベースモデルの間の関連性

OpenAIの研究者は、特定の逆強化学習(IRL)手法、特に最大エントロピーIRLが、敵対的生成ネットワーク(GANs)およびエネルギーベースモデル(EBMs)と数学的に等価であることを実証しました。

7639

OpenAI RL²: 遅い強化学習を介した高速強化学習

OpenAIは、リカレントニューラルネットワーク(RNN)を使用して強化学習アルゴリズムを学習する方法であるRL²を紹介します。これにより、エージェントはRNNの重みに学習プロセス自身をエンコードすることにより、数回の試行で新しいタスクに適応できるようになります。

7640

OpenAI Variational Lossy Autoencoder 研究

OpenAIは、VAEとニューラル自己回帰モデルを組み合わせたVariational Lossy Autoencoderを導入し、画像のテクスチャなどの関係のないローカルな詳細を破棄しながら、グローバルな表現を学習します。

7641

OpenAI Neural GPU: 拡張と制限

OpenAIの研究者は、カリキュラム学習とモデルサイズの増加により、Neural GPUの10進数の算術や複雑な式などのアルゴリズムタスクを学習する能力を向上させました。

7642

OpenAI 半教師あり知識転移によるプライベート トレーニング データ

OpenAI は、Private Aggregation of Teacher Ensembles (PATE) というフレームワークを紹介します。このフレームワークは、教師モデル間のノイズ付き投票を使用して、強い微分プライバシー保証を持つ学生モデルを訓練します。

7643

OpenAI 自己組織型機械学習カンファレンス (SOCML)

OpenAI は、150 人の AI 実践者間でのピアツーピア教育と偶発的な相互作用を通じて AI 研究を加速するため、初めての自己組織型機械学習カンファレンスを開催しました。

7644

シミュレーションから実世界への転移 ― ディープ逆動力学モデルの学習による – OpenAI 2016

OpenAIの研究者は、ディープ逆動力学モデルを学習してシミュレーションで予測される次の状態を適切な実世界の行動にマッピングすることにより、正確な動力学モデルを必要とせずにシミュレーションと実世界のギャップを縮小しながら、シミュレーションで学習した制御ポリシーを実ロボットに転移する手法を発表した。

7645

OpenAI のディープラーニングインフラと Kubernetes-EC2 オートスケーラ

OpenAI はディープラーニング向けインフラストラクチャの実践を公開し、研究者が AWS とオンプレミスの GPU クラスタ間でバースト的なワークロードをスケールできるようにする Kubernetes‑EC2 オートスケーラをリリースしました。

7646

OpenAI Machine Learning Unconference 2016 開催のお知らせ

OpenAIは、2016年10月7日から8日にかけてサンフランシスコのオフィスで開催される、無料のMachine Learning Unconferenceの開催を発表しました。このイベントは、MLの研究者や実務家の間での参加者主導の議論とネットワーキングを促進することを目的としています。

7647

OpenAI チームアップデート 2016年8月:新しい正社員およびインターン

2016年8月16日、OpenAIは5名の新しい正社員の研究者およびエンジニア、ならびに数名のインターンと訪問者の追加を発表し、音声、安全性、戦略、GPU最適化、ディープラーニング、および関連分野における専門知識を拡大しました。

7648

OpenAI 特別プロジェクト 2016

OpenAIは2016年に、AI能力の向上と社会的リスクの軽減に焦点を当てた4つの優先問題領域のリストを発表しました。これには、AI検出、自動プログラミング、サイバーセキュリティ、複雑なシミュレーションが含まれます。

7649

OpenAI と Google Brain:AI 安全性における具体的課題

OpenAI、Google Brain、Berkeley、Stanford の研究者は、現代の機械学習システムが意図通りに動作することを保証するための AI 安全性における 5 つの核心的技術課題を特定しました。

7650

OpenAI の技術目標(2016年)

OpenAI は 2016 年に初期の技術ロードマップを示し、汎用インテリジェンス指標の作成と、ロボティクス、自然言語理解、マルチゲームマスタリーが可能なエージェントの開発に焦点を当てました。