OpenAI Scholars 2019 プログラム発表
OpenAIはOpenAI Scholars第2期の応募を開始し、過小代表グループの個人に奨学金とメンターシップを提供してディープラーニングを学び、プロジェクトをオープンソース化します。
OpenAIフェローズ 2019年冬プログラムとインターン 2019年夏プログラム
OpenAIは、2019年冬のフェローズプログラムと2019年夏のインターンシップの応募受付開始を発表しました。これらは、多様なバックグラウンドを持つ研究者や学生をAI研究に統合することを目的としています。
FFJORD: スケーラブルな可逆生成モデルのためのフリーフォーム連続ダイナミクス
OpenAIは、Hutchinsonのトレース推定器を使用して制限のないニューラルネットワークアーキテクチャを可能にし、スケーラブルな密度推定を実現する連続時間の可逆生成モデルであるFFJORDを紹介します。
OpenAI Scholars 2018 最終プロジェクト
OpenAIは、2018年のScholarsプログラムの最終プロジェクトを紹介するショーケースを公開し、音楽生成、直感的な物理学、自然言語処理における機械学習の多様な応用例を取り上げました。
OpenAI Five: The International 2018 の結果
OpenAI FiveはThe International 2018で世界クラスのプロDota 2プレイヤーと対戦し、'Real Dota' ルール下で両試合とも敗北したものの、高レベルのゲームプレイを示しました。
OpenAI 大規模好奇心駆動学習の研究
OpenAI の研究者は、予測誤差に基づく内在的好奇心報酬のみで訓練されたエージェントが、手作りの外部報酬を一切使用せずに 54 のベンチマーク環境で高いパフォーマンスを達成できることを実証しました。
OpenAI Five ベンチマーク結果
OpenAI Five は 99.95 パーセンタイルの Dota プレイヤーのチームに対してベストオブスリーシリーズで勝利し、複雑さと不確実性に対処する高度な AI 能力を示しました。
OpenAI Dactyl: ドメインランダム化による器用さの学習
OpenAIは、シミュレーションで人間の手に似たロボットハンドを訓練し、高い器用さで物理的な物体を操作できるシステム「Dactyl」を開発し、微調整なしでそのスキルを実世界に転送しました。
OpenAI 変分オプション発見アルゴリズム
OpenAIは、強化学習エージェントにおける多様な行動モードの発見を安定化させるために、Variational Autoencoding Learning of Options by Reinforcement(VALOR)とカリキュラム学習アプローチを導入します。
OpenAI Scholars 2018: 私たちの奨学生をご紹介
OpenAIは2018年のScholarsコホートを発表し、強化学習、言語モデリング、AIと芸術の交差点など多様な分野に取り組む研究者グループを紹介しました。
OpenAI Five ベンチマーク
OpenAIは、拡張されたヒーロープールと更新されたゲームメカニクスを備えたOpenAI Fiveのベンチマークマッチを発表し、AIを上位パーセンタイルの人間プレイヤーとテストします。
Glow: より良い可逆的生成モデル
OpenAIは、可逆的1x1畳み込みを用いたフロー型生成モデルGlowを紹介する。Glowは高解像度画像を生成し、正確な潜在変数推論と効率的なサンプリングを実現する。
単一のデモンストレーションからMontezuma’s Revengeを学ぶ
OpenAIは、単一の人間デモンストレーションを用いて開始状態の逆カリキュラムを作成し、Montezuma’s Revengeで記録的な高得点74,500点を達成するRLエージェントを訓練しました。
OpenAI Five
OpenAI Fiveは、Dota 2におけるセルフプレイで訓練された5つのニューラルネットワークからなるチームで、アマチュア人間チームに勝利し始め、スケールアップされた強化学習が根本的なアルゴリズムの進歩なくても長期的で部分的に観測されるタスクに対処できることを示した。
OpenAI Retro コンテスト結果
OpenAIは初めてのRetroコンテストを終了し、Sonic the Hedgehog向けの最高性能AIエージェントは、PPOやRainbow DQNといった既存アルゴリズムをチューニングまたは拡張することで開発されました。
OpenAI マルチエージェントシステムにおける学習ポリシー表現
OpenAIは、エージェントモデリングを表現学習問題として扱い、最小限の相互作用データでマルチエージェントシステムにおけるエージェント行動を理解するための一般的な学習フレームワークを導入しました。
OpenAIの教師なし学習による言語理解の向上
OpenAIは、教師なし言語モデリングで事前学習し、その後小規模な教師ありデータセットでファインチューニングしたTransformerベースのモデルが、常識推論を含む多様な言語タスクで最先端の結果を達成できることを示しました。
GamePad: 定理証明のための学習環境
OpenAIは、Coq証明アシスタント内で定理証明に機械学習手法を適用し、タクティック予測と位置評価を自動化することを目的としたシステム、GamePadを導入しました。
OpenAIフェローズプログラム 2018年秋
OpenAIは2018年秋にフェローズプログラムを開始し、正式なAIのバックグラウンドを持たない個人が人工知能研究へ移行できる道筋を提供しました。
OpenAI Gym Retro リリース
OpenAIは、エージェントの汎化研究を可能にするため、複数のクラシックコンソールにわたって利用可能なゲームライブラリを1,000本以上に拡大した強化学習プラットフォーム、Gym Retroのフルバージョンをリリースしました。
OpenAI AI と計算分析
OpenAI の分析によると、最大規模の AI 訓練に使用される計算量は 2012 年以降指数的に増加しており、3.4 か月ごとに倍増し、ムーアの法則をはるかに上回っています。
議論によるAI安全性
OpenAIは、AIエージェントにトピックについて議論させる安全技術を提案し、人間が認知能力を超えるタスクを実行するシステムを監督できるようにします。
OpenAI 進化的ポリシー勾配 (EPG)
OpenAI は、損失関数を進化させ、タスクファミリー内の新しいタスクへ一般化できるようにするメタラーニング手法である Evolved Policy Gradients (EPG) を紹介します。
OpenAI Gotta Learn Fast ベンチマーク
OpenAIは、Sonic the Hedgehogのビデオゲームフランチャイズを基にした新しい強化学習ベンチマークを導入し、転移学習と少数ショット学習の性能を測定します。
OpenAI Retro コンテストと Gym Retro のリリース
OpenAI は、未見のビデオゲームレベルに対する強化学習の汎化を測定する Retro コンテストを開始し、30 本の SEGA Genesis と 62 本の Atari 2600 ゲームを Gym に統合したプラットフォームである Gym Retro をリリースしました。
OpenAI のアクション依存因子分解ベースラインによるポリシー勾配の分散削減
OpenAI の研究者は、勾配推定の分散を低減し、高次元アクション空間での学習を高速化するバイアスフリーなアクション依存ベースラインをポリシー勾配法向けに開発しました。
OpenAI OT-GAN: 最適輸送を用いたGANの改善
OpenAIは、トレーニングの安定性と画像生成品質を向上させる新しいミニバッチエネルギー距離指標を使用した、生成的敵対ネットワークのバリアントであるOptimal Transport GAN(OT-GAN)を紹介します。
OpenAIハッカソンレポート 2018年3月
OpenAIは2018年3月3日に初めてのハッカソンを開催し、AIコミュニティのメンバー100名がヘルスケア、AI安全性、強化学習にまたがるプロジェクトを開発しました。
一次階メタラーニングアルゴリズムについて
OpenAIは、二階微分を必要とせずにパラメータ初期化を最適化することで、エージェントが新しいタスクを迅速に学習できる一次階メタラーニングアルゴリズム「Reptile」を紹介します。
OpenAI Reptile: スケーラブルなメタラーニングアルゴリズム
OpenAI は Reptile を導入しました。これはスケーラブルなメタラーニングアルゴリズムで、同一タスク内の異なるミニバッチの勾配間の内積を最大化することで、モデルが少数の例から一般化できるようにします。
OpenAI スカラーズプログラム
OpenAIは、過小代表グループの個人に対し、ディープラーニングを学びプロジェクトをオープンソース化するための奨学金とメンターシップを提供するOpenAI Scholarsプログラムを開始しました。
OpenAI研究:メタ強化学習による探索の学習
OpenAIの研究者は、複雑な環境における探索性能を向上させることを目的とした2つのメタ強化学習アルゴリズム、E-MAMLとE-RL²を導入しました。
OpenAI ロボティクス研究のための材料
OpenAI は、複雑な操作タスクにおけるスパース報酬からの強化学習を可能にするため、8 つのシミュレートされたロボティクス環境と Baselines の Hindsight Experience Replay (HER) 実装をリリースしました。
OpenAI マルチゴール強化学習ロボティクス環境
OpenAI は、OpenAI Gym と統合された挑戦的な連続制御ロボットタスクのスイートをリリースし、マルチゴール強化学習の研究を推進しました。
OpenAI ハッカソン 2018年3月
OpenAIは2018年3月3日にサンフランシスコでコミュニティハッカソンと一連のトークを開催し、AIの学習とプロジェクト開発を促進しました。
OpenAI サポーターと組織のアップデート
OpenAIは、新しいドナー、アドバイザーの任命、そしてテスラのAI焦点との潜在的な利益相反を避けるためにイーロン・マスクが取締役会を離れたことを発表しました。
OpenAI の悪意ある AI 利用への備え
OpenAI とパートナーは、悪意ある行為者による AI の悪用を予測し、これらのグローバルな安全保障脅威を緩和するための提言をまとめた研究論文を発表しました。
OpenAI 教えることによる解釈可能な機械学習
OpenAI は、教師-生徒ニューラルネットワークフレームワークを使用して概念の最も示唆的な例を特定し、その結果の解釈が任意ではなく人間に解釈可能であることを保証する機械教授アプローチを導入します。
OpenAIによるエンティティ曖昧さ回避のためのタイプの発見
OpenAIは、CoNLLおよびTAC KBP 2010データセットにおけるエンティティ曖昧さ回避の精度を向上させるために、ニューラルネットワークを使用して自動的に発見されたタイプへの所属を予測するシステムを開発しました。
OpenAI リサーチのためのリクエスト 2.0
OpenAI は、コミュニティの貢献を促すために、強化学習と機械学習における未解決の技術的問題 7 つのコレクションである Requests for Research 2.0 をリリースしました。
Kubernetesを2,500ノードにスケーリング
OpenAIは、ディープラーニング研究のためにAzure上でKubernetesクラスターを2,500ノードにスケーリングするために必要な技術的最適化について説明しており、etcd、ネットワーク、イメージプルのボトルネックに対処しています。
OpenAI ブロック疎 GPU カーネル
OpenAI は、ブロック疎ニューラルネットワークアーキテクチャ向けの高度に最適化された GPU カーネルをリリースし、モデルをより幅広くかつ深くしながら、cuBLAS または cuSPARSE よりも桁違いに高速に動作させることを可能にしました。
OpenAIがL0正則化を通じてスパースニューラルネットワークを学習
OpenAIは、確率的ゲートを使用して重みを正確にゼロにすることで、L0ノルム正則化によるスパースモデルを作成し、訓練速度、推論速度、そして汎化性能を向上させる手法を導入しました。
OpenAI 解釈可能かつ教育的な例の研究
OpenAIの研究者たちは、教師と学生のニューラルネットワークを共同ではなく反復的に訓練することで、AIと人間の両方に効果的に教えることができる解釈可能な教学戦略が生成されることを示しています。
OpenAI の階層学習リサーチ
OpenAI は、複雑で長時間的なタスクを総当たり法よりも効率的に解決するために、高レベルのアクションを自動的に発見する強化学習アルゴリズムである Meta-Learning Shared Hierarchies (MLSH) を開発しました。
OpenAI シミュレーションからの一般化
OpenAIは、ダイナミクスとドメインランダマイズを使用して、シミュレーションでロボットコントローラーを訓練する技術を開発しました。これにより、物理ロボットに一般化し、予期しない環境変化に反応できるようになります。
OpenAI ダイナミクス ランダマイズ を用いた ロボット制御 の Sim-to-Real 転移
OpenAI の研究者は、シミュレーションでのみ訓練されたロボット制御ポリシーが、追加の物理トレーニングなしで実世界のハードウェアに転移できるダイナミクス ランダマイズ 法を開発しました。
OpenAI の画像ベースロボット学習向け非対称アクタークリティック
OpenAI は、クリティックをシミュレータの完全状態で訓練し、アクターは RGBD 画像のみを使用する非対称アクタークリティックフレームワークを導入し、実世界データを使用せずに効率的なシミュレーションから実世界への転送を可能にします。
OpenAI ドメインランダム化と生成モデルによるロボットの把持
OpenAIは、ドメインランダム化と自己回帰モデルを使用したデータ生成パイプラインを開発し、シミュレーションのみのトレーニングデータで未見のオブジェクトに対して実世界での把持成功率80%を達成しました。
OpenAI メタラーニング レスリング向け
OpenAI は、メタラーニング エージェントがシミュレートされたロボットレスリングにおいて、より強固な固定ポリシー エージェントに打ち勝つために戦術を素早く適応させ、物理的な故障から回復できることを示した。