2101

OpenAI 해커톤 보고서 2018년 3월

OpenAI는 2018년 3월 3일에 첫 해커톤을 개최하여 100명의 AI 커뮤니티 구성원을 모아 헬스케어, 안전, 강화 학습에 걸친 프로젝트를 개발했습니다.

2102

1차 메타러닝 알고리즘에 대하여

OpenAI는 Reptile이라는 1차 메타러닝 알고리즘을 소개합니다. 이 알고리즘은 파라미터 초기값을 최적화함으로써 2차 미분 없이도 에이전트가 새로운 작업을 빠르게 학습할 수 있게 합니다.

2103

OpenAI Reptile: 확장 가능한 메타러닝 알고리즘

OpenAI는 동일 작업의 서로 다른 미니배치 그라디언트 간 내적을 최대화함으로써 모델이 소수의 예시만으로 일반화할 수 있게 하는 확장 가능한 메타러닝 알고리즘 Reptile을 소개했습니다.

2104

OpenAI 장학 프로그램

OpenAI는 소수자 그룹에 속한 개인들에게 장학금과 멘토링을 제공하여 딥러닝을 공부하고 프로젝트를 오픈소스화할 수 있도록 OpenAI Scholars 프로그램을 시작했습니다.

2105

OpenAI 연구: 메타 강화 학습을 통한 탐색 학습

OpenAI 연구원들은 복잡한 환경에서 탐색 성능을 향상시키기 위해 설계된 두 가지 메타 강화 학습 알고리즘인 E-MAML과 E-RL²를 소개했습니다.

2106

OpenAI 로봇 연구를 위한 재료

OpenAI는 복잡한 조작 작업에서 희소 보상으로부터 강화 학습을 가능하게 하기 위해 여덟 개의 시뮬레이션 로봇 환경과 Baselines 구현의 Hindsight Experience Replay (HER)를 공개했습니다.

2107

OpenAI 멀티-목표 강화 학습 로봇 환경

OpenAI는 연구를 진전시키기 위해 OpenAI Gym과 통합된 도전적인 연속 제어 로봇 작업 세트를 출시했습니다.

2108

OpenAI 해커톤 2018년 3월

OpenAI는 AI 학습과 프로젝트 개발을 장려하기 위해 2018년 3월 3일 샌프란시스코에서 커뮤니티 해커톤과 일련의 강연을 개최했습니다.

2109

OpenAI 후원자 및 조직 업데이트

OpenAI는 새로운 후원자, 고문 임명, 그리고 테슬라의 AI 집중과 관련된 잠재적 갈등을 피하기 위해 엘론 머스크의 이사회 퇴임을 발표했습니다.

2110

OpenAI, 악의적인 AI 사용에 대비 중

OpenAI와 파트너들은 악의적인 행위자가 AI를 악용할 수 있음을 예측하고 이러한 글로벌 보안 위협을 완화하기 위한 권장 사항을 제시하는 연구 논문을 발표했습니다.

2111

OpenAI 가르침을 통한 해석 가능한 머신 러닝

OpenAI는 교사-학생 신경망 프레임워크를 활용하여 개념의 가장 설명적인 예시를 식별하는 머신 교수법을 도입하여, 결과 해석이 임의적이지 않고 인간에게 해석 가능하도록 보장합니다.

2112

OpenAI 엔티티 디스암비게이션을 위한 타입 발견

OpenAI는 자동으로 발견된 타입에 대한 소속을 예측하기 위해 신경망을 사용하는 시스템을 개발하여 CoNLL 및 TAC KBP 2010 데이터셋에서 엔티티 디스암비게이션 정확도를 향상시켰습니다.

2113

OpenAI 연구 요청 2.0

OpenAI는 커뮤니티 기여를 장려하기 위해 강화 학습과 기계 학습 분야의 미해결 기술 문제 일곱 가지로 구성된 Requests for Research 2.0을 발표했습니다.

2114

2,500 노드로 Kubernetes 확장

OpenAI는 딥러닝 연구를 위해 Azure에서 Kubernetes 클러스터를 2,500 노드로 확장하기 위해 필요한 기술적 최적화를 설명하며, etcd, 네트워킹, 이미지 풀에서의 병목 현상을 해결합니다.

2115

OpenAI 블록-스파스 GPU 커널

OpenAI는 블록-스파스 신경망 아키텍처용으로 고도로 최적화된 GPU 커널을 출시하여, 모델을 더 넓고 깊게 만들면서 cuBLAS 또는 cuSPARSE보다 주문 단위 이상 빠른 속도로 실행할 수 있게 했습니다.

2116

OpenAI, L0 정규화를 통한 희소 신경망 학습

OpenAI는 신경망에서 L0 노름 정규화를 이용해 가중치를 정확히 0으로 만들 수 있는 확률 게이트를 사용함으로써 훈련 속도, 추론 속도 및 일반화를 향상시키는 희소 모델을 만드는 방법을 소개합니다.

2117

OpenAI 해석 가능하고 교육적인 예시 연구

OpenAI 연구진은 교사와 학생 신경망을 공동 훈련이 아닌 반복적으로 훈련시킴으로써 해석 가능한 교육 전략을 생성하며, 이는 AI와 인간 모두에게 효과적으로 가르칠 수 있음을 보여준다.

2118

OpenAI 계층 학습 연구

OpenAI는 Meta-Learning Shared Hierarchies(MLSH)라고 하는 강화 학습 알고리즘을 개발하여 고수준 행동을 자동으로 발견함으로써 브루트포스 방법보다 복잡하고 장기 과제를 더 효율적으로 해결할 수 있게 했습니다.

2119

OpenAI 시뮬레이션에서 일반화하기

OpenAI는 동역학 및 도메인 랜덤화 기술을 사용하여 시뮬레이션에서 로봇 컨트롤러를 훈련시켜 물리적 로봇에 일반화하고 계획되지 않은 환경 변화에 반응할 수 있도록 하였다.

2120

OpenAI 동적 랜덤화를 이용한 로봇 제어의 시뮬레이션에서 실제 세계로의 전이

OpenAI 연구진은 시뮬레이션에서 전용으로 훈련된 로봇 제어 정책이 추가적인 물리적 훈련 없이 실제 세계 하드웨어로 전이될 수 있도록 하는 동적 랜덤화 방법을 개발했습니다.

2121

OpenAI 비대칭 액터-크리틱 이미지 기반 로봇 학습

OpenAI는 시뮬레이터의 전체 상태에서 크리틱을 훈련시키고 액터는 오직 RGBD 이미지에만 의존하도록 함으로써 로봇 학습을 개선하는 비대칭 액터-크리틱 프레임워크를 도입하여 실제 세계 데이터 없이 효율적인 시뮬레이션-실제 전이를 가능하게 합니다.

2122

OpenAI 도메인 랜덤화 및 생성 모델을 이용한 로봇 잡기

OpenAI는 도메인 랜덤화와 자기회귀 모델을 사용하는 데이터 생성 파이프라인을 개발하여, 오직 시뮬레이션 훈련 데이터만을 사용해 보지 못한 객체에 대한 실제 세계 잡기 성공률 80%를 달성했습니다.

2123

OpenAI 메타 학습 레슬링

OpenAI는 메타 학습 에이전트가 시뮬레이션된 로봇 레슬링에서 더 강한 고정 정책 에이전트를 물리치기 위해 전술을 빠르게 적응시키고 신체적 오작동에서 회복할 수 있음을 보여주었다.

2124

OpenAI 경쟁적 셀프플레이 연구

OpenAI는 경쟁적 셀프플레이가 시뮬레이션된 3D 로봇이 인간 설계 없이 복잡한 신체 기술(태클, 다이빙 등)을 자율적으로 발견할 수 있음을 보여주었다.

2125

딥 선형 네트워크에서의 비선형 계산

OpenAI 연구원들은 부동소수점 산술의 0 주변 언더플로를 활용하여 딥 선형 네트워크가 비선형 계산을 수행할 수 있음을 발견했다.

2126

OpenAI와 옥스퍼드가 다중 에이전트 강화 학습을 위한 LOLA를 소개합니다

OpenAI와 옥스퍼드 대학교는 상대방 학습 인식(LOLA)을 개발했는데, 이는 다른 에이전트의 학습을 형성하여 상호 이익을 달성하는 강화 학습 에이전트입니다.

2127

OpenAI 상대 학습 인식을 고려한 학습 (LOLA)

OpenAI는 상대 학습 인식을 고려한 학습(LOLA)을 소개합니다. 이는 에이전트가 다른 에이전트의 학습을 형성하여 협력을 촉진하고 나시 균형에 도달할 수 있게 하는 다중 에이전트 강화 학습 방법입니다.

2128

OpenAI Baselines: ACKTR & A2C

OpenAI가 더 높은 샘플 효율성을 가진 강화 학습 알고리즘인 ACKTR과 A3C의 동기식 결정론적 변형인 A2C를 포함하는 Baselines 구현체를 출시했습니다.

2129

OpenAI Dota 2 1v1 봇 결과

OpenAI는 초인간 성능을 달성한 강화 학습 에이전트를 Dota 2 1v1에서 개발했으며, 이는 자체 플레이가 기계 학습 시스템을 인간 수준을 넘어 확장할 수 있음을 보여줍니다.

2130

OpenAI Dota 2 봇 발표

OpenAI는 자기 플레이 강화 학습을 사용하고 모방 학습이나 트리 검색 없이 1v1 경기에서 최고 수준의 프로 Dota 2 플레이어를 물리칠 수 있는 봇을 개발했습니다.

2131

OpenAI RL-Teacher 출시

OpenAI는 occasional human feedback을 통해 AI 에이전트를 훈련시킬 수 있는 오픈소스 인터페이스인 RL-Teacher를 출시했습니다. 이는 hand-crafted reward functions를 대체합니다.

2132

OpenAI 파라미터 노이즈를 통한 개선된 탐색

OpenAI는 액션 공간이 아닌 신경망 파라미터에 적응형 노이즈를 추가하는 방법을 도입하여 강화학습 성능과 탐색 일관성을 크게 향상시켰다.

2133

근접 정책 최적화 (PPO) 릴리스 노트 – OpenAI Baselines

OpenAI는 구현이 간단하면서도 최신 성능을 능가하거나 동등하게 맞추는 강화 학습 알고리즘인 근접 정책 최적화 (PPO)를 출시했으며, OpenAI에서 기본 RL 방법으로 채택되었습니다.

2134

OpenAI 강건한 적대적 입력 연구

OpenAI는 다양한 규모와 관점에서 적대적인 상태를 유지하는 이미지를 개발했으며, 이는 자율주행차와 같은 시스템에서 다중 관점 이미지 캡처가 악의적인 속임을 방지한다는 개념에 도전합니다.

2135

OpenAI 후향 경험 재생

OpenAI는 실패한 시도를 대체 목표의 성공적인 달성으로 간주함으로써 희소하고 이진한 보상으로부터 샘플 효율적인 강화 학습을 가능하게 하는 기술인 Hindsight Experience Replay를 도입했습니다.

2136

OpenAI Teacher–Student Curriculum Learning

OpenAI가 학생의 학습 진도와 성능 저하를 기반으로 하위 작업을 선택하여 훈련을 최적화하는 자동 프레임워크인 Teacher–Student Curriculum Learning (TSCL)을 소개합니다.

2137

mujoco-py 1.50.1.0 release notes / what's new

OpenAI가 배치 시뮬레이션과 GPU 가속 렌더링을 도입한 MuJoCo 엔진용 고성능 Python 3 바인딩인 mujoco-py 1.50.1.0을 오픈 소스로 공개했습니다.

2138

OpenAI 인간 선호로부터 학습

OpenAI와 DeepMind는 인간 선호 비교로부터 목표를 추론하는 강화 학습 알고리즘을 개발하여 수동으로 작성된 보상 함수의 필요성을 줄였습니다.

2139

OpenAI MADDPG: 협력, 경쟁 및 통신 학습하기

OpenAI는 중앙 집중식 학습과 분산 실행을 사용하여 여러 에이전트가 복잡한 환경에서 협력하고 경쟁할 수 있도록 하는 강화 학습 알고리즘인 MADDPG를 소개했습니다.

2140

OpenAI의 Q-앙상블을 통한 UCB 탐색

OpenAI 연구진은 상위 신뢰 한계(UCB)를 기반으로 한 Q*-함수 앙상블을 사용한 탐색 전략을 개발하여 Atari 벤치마크에서의 딥 강화 학습 성능을 향상시켰다.

2141

OpenAI Baselines: DQN 출시 및 강화 학습 모범 사례

OpenAI는 강화 학습의 재현성을 높이기 위해 고성능 DQN 구현과 그 변형 세 가지로 시작하는 OpenAI Baselines를 오픈소스로 공개했습니다.

2142

OpenAI 로봇이 배우는 법: 시뮬레이션에서의 원샷 모방 학습

OpenAI는 시뮬레이션에서 완전히 훈련된 로봇 시스템을 개발하여, VR을 통해 제공된 단일 인간 시연으로부터 새로운 작업을 학습할 수 있습니다.

2143

OpenAI Roboschool 출시

OpenAI는 강화 학습을 위한 물리 기반 환경 모음인 Roboschool을 출시했는데, 이는 MuJoCo 작업을 Bullet 물리 엔진으로 포팅하고 인터랙티브 컨트롤 및 멀티플레이어 훈련에서 새로운 과제를 도입합니다.

2144

정책 그래디언트와 소프트 Q-러닝 사이의 등가성

OpenAI 연구원들은 소프트(엔트로피 정규화) Q-러닝이 수학적으로 정책 그래디언트 방법과 등가임을 보여주며, 두 가지 주요 모델 자유 강화 학습 접근 방식 사이의 이론적 다리를 제공합니다.

2145

계층적 강화 학습을 위한 확률적 신경망

OpenAI 연구자들은 확률적 신경망과 정보이론적 정규화기를 사용하여 해석 가능한 기술을 사전 훈련하여 희소 보상이 있는 다운스트림 작업에서의 학습 속도를 높이는 프레임워크를 제안합니다.

2146

OpenAI 비지도 학습 감정 뉴런

OpenAI는 아마존 리뷰의 다음 문자를 예측하여 감정 표현을 학습하는 비지도 시스템을 개발했으며, 현저히 적은 라벨 예시로 Stanford Sentiment Treebank에서 최첨단 정확도를 달성했습니다.

2147

OpenAI 물리 세계에서의 Spam 탐지

OpenAI는 도메인 랜덤화를 통해 시뮬레이션에서 전적으로 훈련된 VGG16 기반 신경망을 사용하여 물리적인 Spam 캔을 감지할 수 있는 로봇 시스템을 개발했습니다.

2148

확장 가능한 대체물로서의 진화 전략(ES)와 강화 학습

OpenAI 연구진은 Atari와 MuJoCo 벤치마크에서 표준 강화 학습과의 성능을 경쟁할 수 있음을 보여주며, 더 뛰어난 확장성과 더 간단한 구현을 제공한다고 입증했습니다.

2149

OpenAI 원샷 모방 학습

OpenAI는 단일 시연으로부터 새로운 작업을 학습하고 작업별 엔지니어링 없이 새로운 상황에 일반화할 수 있도록 하는 원샷 모방 학습을 위한 메타 학습 프레임워크를 소개합니다.

2150

OpenAI 지원 Distill 저널 출시

OpenAI는 최신 웹 기술을 활용하여 머신러닝 결과의 커뮤니케이션을 개선하는 새로운 저널인 Distill에 대한 지원을 발표했습니다.