OpenAI Gotta Learn Fast 벤치마크
OpenAI는 Sonic the Hedgehog 비디오 게임 프랜차이즈를 기반으로 한 새로운 강화 학습 벤치마크를 도입하여 전이 학습 및 few-shot 학습 성능을 측정합니다.
OpenAI 레트로 콘테스트 및 Gym Retro 출시
OpenAI는 보지 못한 비디오 게임 레벨에서 강화 학습 일반화를 측정하기 위해 레트로 콘테스트를 시작하고, 30개의 SEGA Genesis와 62개의 Atari 2600 게임을 Gym에 통합한 플랫폼인 Gym Retro를 출시했습니다.
OpenAI 행동 의존형 인수분해 베이스라인을 활용한 정책 그래디언트 분산 감소
OpenAI 연구원들은 정책 그래디언트 방법을 위한 편향 없는 행동 의존형 베이스라인을 개발하여 그래디언트 추정 분산을 감소시키고, 고차원 행동 공간에서 더 빠른 학습을 가능하게 했습니다.
OpenAI OT-GAN: 최적 전송을 이용한 GAN 개선
OpenAI는 새로운 미니배치 에너지 거리 측정값을 사용하여 훈련 안정성과 이미지 생성 품질을 향상시키는 생성적 적대 신경망 변형인 Optimal Transport GAN (OT-GAN)을 소개합니다.
OpenAI 해커톤 보고서 2018년 3월
OpenAI는 2018년 3월 3일에 첫 해커톤을 개최하여 100명의 AI 커뮤니티 구성원을 모아 헬스케어, 안전, 강화 학습에 걸친 프로젝트를 개발했습니다.
1차 메타러닝 알고리즘에 대하여
OpenAI는 Reptile이라는 1차 메타러닝 알고리즘을 소개합니다. 이 알고리즘은 파라미터 초기값을 최적화함으로써 2차 미분 없이도 에이전트가 새로운 작업을 빠르게 학습할 수 있게 합니다.
OpenAI Reptile: 확장 가능한 메타러닝 알고리즘
OpenAI는 동일 작업의 서로 다른 미니배치 그라디언트 간 내적을 최대화함으로써 모델이 소수의 예시만으로 일반화할 수 있게 하는 확장 가능한 메타러닝 알고리즘 Reptile을 소개했습니다.
OpenAI 장학 프로그램
OpenAI는 소수자 그룹에 속한 개인들에게 장학금과 멘토링을 제공하여 딥러닝을 공부하고 프로젝트를 오픈소스화할 수 있도록 OpenAI Scholars 프로그램을 시작했습니다.
OpenAI 연구: 메타 강화 학습을 통한 탐색 학습
OpenAI 연구원들은 복잡한 환경에서 탐색 성능을 향상시키기 위해 설계된 두 가지 메타 강화 학습 알고리즘인 E-MAML과 E-RL²를 소개했습니다.
OpenAI 로봇 연구를 위한 재료
OpenAI는 복잡한 조작 작업에서 희소 보상으로부터 강화 학습을 가능하게 하기 위해 여덟 개의 시뮬레이션 로봇 환경과 Baselines 구현의 Hindsight Experience Replay (HER)를 공개했습니다.
OpenAI 멀티-목표 강화 학습 로봇 환경
OpenAI는 연구를 진전시키기 위해 OpenAI Gym과 통합된 도전적인 연속 제어 로봇 작업 세트를 출시했습니다.
OpenAI 해커톤 2018년 3월
OpenAI는 AI 학습과 프로젝트 개발을 장려하기 위해 2018년 3월 3일 샌프란시스코에서 커뮤니티 해커톤과 일련의 강연을 개최했습니다.
OpenAI 후원자 및 조직 업데이트
OpenAI는 새로운 후원자, 고문 임명, 그리고 테슬라의 AI 집중과 관련된 잠재적 갈등을 피하기 위해 엘론 머스크의 이사회 퇴임을 발표했습니다.
OpenAI, 악의적인 AI 사용에 대비 중
OpenAI와 파트너들은 악의적인 행위자가 AI를 악용할 수 있음을 예측하고 이러한 글로벌 보안 위협을 완화하기 위한 권장 사항을 제시하는 연구 논문을 발표했습니다.
OpenAI 가르침을 통한 해석 가능한 머신 러닝
OpenAI는 교사-학생 신경망 프레임워크를 활용하여 개념의 가장 설명적인 예시를 식별하는 머신 교수법을 도입하여, 결과 해석이 임의적이지 않고 인간에게 해석 가능하도록 보장합니다.
OpenAI 엔티티 디스암비게이션을 위한 타입 발견
OpenAI는 자동으로 발견된 타입에 대한 소속을 예측하기 위해 신경망을 사용하는 시스템을 개발하여 CoNLL 및 TAC KBP 2010 데이터셋에서 엔티티 디스암비게이션 정확도를 향상시켰습니다.
OpenAI 연구 요청 2.0
OpenAI는 커뮤니티 기여를 장려하기 위해 강화 학습과 기계 학습 분야의 미해결 기술 문제 일곱 가지로 구성된 Requests for Research 2.0을 발표했습니다.
2,500 노드로 Kubernetes 확장
OpenAI는 딥러닝 연구를 위해 Azure에서 Kubernetes 클러스터를 2,500 노드로 확장하기 위해 필요한 기술적 최적화를 설명하며, etcd, 네트워킹, 이미지 풀에서의 병목 현상을 해결합니다.
OpenAI 블록-스파스 GPU 커널
OpenAI는 블록-스파스 신경망 아키텍처용으로 고도로 최적화된 GPU 커널을 출시하여, 모델을 더 넓고 깊게 만들면서 cuBLAS 또는 cuSPARSE보다 주문 단위 이상 빠른 속도로 실행할 수 있게 했습니다.
OpenAI, L0 정규화를 통한 희소 신경망 학습
OpenAI는 신경망에서 L0 노름 정규화를 이용해 가중치를 정확히 0으로 만들 수 있는 확률 게이트를 사용함으로써 훈련 속도, 추론 속도 및 일반화를 향상시키는 희소 모델을 만드는 방법을 소개합니다.
OpenAI 해석 가능하고 교육적인 예시 연구
OpenAI 연구진은 교사와 학생 신경망을 공동 훈련이 아닌 반복적으로 훈련시킴으로써 해석 가능한 교육 전략을 생성하며, 이는 AI와 인간 모두에게 효과적으로 가르칠 수 있음을 보여준다.
OpenAI 계층 학습 연구
OpenAI는 Meta-Learning Shared Hierarchies(MLSH)라고 하는 강화 학습 알고리즘을 개발하여 고수준 행동을 자동으로 발견함으로써 브루트포스 방법보다 복잡하고 장기 과제를 더 효율적으로 해결할 수 있게 했습니다.
OpenAI 시뮬레이션에서 일반화하기
OpenAI는 동역학 및 도메인 랜덤화 기술을 사용하여 시뮬레이션에서 로봇 컨트롤러를 훈련시켜 물리적 로봇에 일반화하고 계획되지 않은 환경 변화에 반응할 수 있도록 하였다.
OpenAI 동적 랜덤화를 이용한 로봇 제어의 시뮬레이션에서 실제 세계로의 전이
OpenAI 연구진은 시뮬레이션에서 전용으로 훈련된 로봇 제어 정책이 추가적인 물리적 훈련 없이 실제 세계 하드웨어로 전이될 수 있도록 하는 동적 랜덤화 방법을 개발했습니다.
OpenAI 비대칭 액터-크리틱 이미지 기반 로봇 학습
OpenAI는 시뮬레이터의 전체 상태에서 크리틱을 훈련시키고 액터는 오직 RGBD 이미지에만 의존하도록 함으로써 로봇 학습을 개선하는 비대칭 액터-크리틱 프레임워크를 도입하여 실제 세계 데이터 없이 효율적인 시뮬레이션-실제 전이를 가능하게 합니다.
OpenAI 도메인 랜덤화 및 생성 모델을 이용한 로봇 잡기
OpenAI는 도메인 랜덤화와 자기회귀 모델을 사용하는 데이터 생성 파이프라인을 개발하여, 오직 시뮬레이션 훈련 데이터만을 사용해 보지 못한 객체에 대한 실제 세계 잡기 성공률 80%를 달성했습니다.
OpenAI 메타 학습 레슬링
OpenAI는 메타 학습 에이전트가 시뮬레이션된 로봇 레슬링에서 더 강한 고정 정책 에이전트를 물리치기 위해 전술을 빠르게 적응시키고 신체적 오작동에서 회복할 수 있음을 보여주었다.
OpenAI 경쟁적 셀프플레이 연구
OpenAI는 경쟁적 셀프플레이가 시뮬레이션된 3D 로봇이 인간 설계 없이 복잡한 신체 기술(태클, 다이빙 등)을 자율적으로 발견할 수 있음을 보여주었다.
딥 선형 네트워크에서의 비선형 계산
OpenAI 연구원들은 부동소수점 산술의 0 주변 언더플로를 활용하여 딥 선형 네트워크가 비선형 계산을 수행할 수 있음을 발견했다.
OpenAI와 옥스퍼드가 다중 에이전트 강화 학습을 위한 LOLA를 소개합니다
OpenAI와 옥스퍼드 대학교는 상대방 학습 인식(LOLA)을 개발했는데, 이는 다른 에이전트의 학습을 형성하여 상호 이익을 달성하는 강화 학습 에이전트입니다.
OpenAI 상대 학습 인식을 고려한 학습 (LOLA)
OpenAI는 상대 학습 인식을 고려한 학습(LOLA)을 소개합니다. 이는 에이전트가 다른 에이전트의 학습을 형성하여 협력을 촉진하고 나시 균형에 도달할 수 있게 하는 다중 에이전트 강화 학습 방법입니다.
OpenAI Baselines: ACKTR & A2C
OpenAI가 더 높은 샘플 효율성을 가진 강화 학습 알고리즘인 ACKTR과 A3C의 동기식 결정론적 변형인 A2C를 포함하는 Baselines 구현체를 출시했습니다.
OpenAI Dota 2 1v1 봇 결과
OpenAI는 초인간 성능을 달성한 강화 학습 에이전트를 Dota 2 1v1에서 개발했으며, 이는 자체 플레이가 기계 학습 시스템을 인간 수준을 넘어 확장할 수 있음을 보여줍니다.
OpenAI Dota 2 봇 발표
OpenAI는 자기 플레이 강화 학습을 사용하고 모방 학습이나 트리 검색 없이 1v1 경기에서 최고 수준의 프로 Dota 2 플레이어를 물리칠 수 있는 봇을 개발했습니다.
OpenAI RL-Teacher 출시
OpenAI는 occasional human feedback을 통해 AI 에이전트를 훈련시킬 수 있는 오픈소스 인터페이스인 RL-Teacher를 출시했습니다. 이는 hand-crafted reward functions를 대체합니다.
파라미터 노이즈를 통한 더 나은 탐색
OpenAI의 2017년 연구는 강화 학습 정책에 적응형 파라미터 노이즈를 추가하면 탐색이 개선되고 점수가 더 높아진다는 것을 보여줍니다. 이는 HalfCheetah 및 Atari/Mujoco 벤치마크에서 입증되었습니다.
근접 정책 최적화 (PPO) 릴리스 노트 – OpenAI Baselines
OpenAI는 구현이 간단하면서도 최신 성능을 능가하거나 동등하게 맞추는 강화 학습 알고리즘인 근접 정책 최적화 (PPO)를 출시했으며, OpenAI에서 기본 RL 방법으로 채택되었습니다.
OpenAI 강건한 적대적 입력 연구
OpenAI는 다양한 규모와 관점에서 적대적인 상태를 유지하는 이미지를 개발했으며, 이는 자율주행차와 같은 시스템에서 다중 관점 이미지 캡처가 악의적인 속임을 방지한다는 개념에 도전합니다.
OpenAI 후향 경험 재생
OpenAI는 실패한 시도를 대체 목표의 성공적인 달성으로 간주함으로써 희소하고 이진한 보상으로부터 샘플 효율적인 강화 학습을 가능하게 하는 기술인 Hindsight Experience Replay를 도입했습니다.
OpenAI Teacher–Student Curriculum Learning
OpenAI가 학생의 학습 진도와 성능 저하를 기반으로 하위 작업을 선택하여 훈련을 최적화하는 자동 프레임워크인 Teacher–Student Curriculum Learning (TSCL)을 소개합니다.
mujoco-py 1.50.1.0 release notes / what's new
OpenAI가 배치 시뮬레이션과 GPU 가속 렌더링을 도입한 MuJoCo 엔진용 고성능 Python 3 바인딩인 mujoco-py 1.50.1.0을 오픈 소스로 공개했습니다.
OpenAI 인간 선호로부터 학습
OpenAI와 DeepMind는 인간 선호 비교로부터 목표를 추론하는 강화 학습 알고리즘을 개발하여 수동으로 작성된 보상 함수의 필요성을 줄였습니다.
협력하고 경쟁하며 소통하기 – OpenAI 2017 연구 발표
OpenAI는 2017년 6월에 중앙 비평가 기반 다중 에이전트 강화 학습 알고리즘인 MADDPG를 소개했으며, 이를 통해 에이전트가 공유 환경에서 협력, 경쟁 및 소통을 학습할 수 있게 했습니다.
OpenAI의 Q-앙상블을 통한 UCB 탐색
OpenAI 연구진은 상위 신뢰 한계(UCB)를 기반으로 한 Q*-함수 앙상블을 사용한 탐색 전략을 개발하여 Atari 벤치마크에서의 딥 강화 학습 성능을 향상시켰다.
OpenAI Baselines: DQN 출시 및 강화 학습 모범 사례
OpenAI는 강화 학습의 재현성을 높이기 위해 고성능 DQN 구현과 그 변형 세 가지로 시작하는 OpenAI Baselines를 오픈소스로 공개했습니다.
OpenAI 로봇이 배우는 법: 시뮬레이션에서의 원샷 모방 학습
OpenAI는 시뮬레이션에서 완전히 훈련된 로봇 시스템을 개발하여, VR을 통해 제공된 단일 인간 시연으로부터 새로운 작업을 학습할 수 있습니다.
OpenAI Roboschool 출시
OpenAI는 강화 학습을 위한 물리 기반 환경 모음인 Roboschool을 출시했는데, 이는 MuJoCo 작업을 Bullet 물리 엔진으로 포팅하고 인터랙티브 컨트롤 및 멀티플레이어 훈련에서 새로운 과제를 도입합니다.
정책 그래디언트와 소프트 Q-러닝 사이의 등가성
OpenAI 연구원들은 소프트(엔트로피 정규화) Q-러닝이 수학적으로 정책 그래디언트 방법과 등가임을 보여주며, 두 가지 주요 모델 자유 강화 학습 접근 방식 사이의 이론적 다리를 제공합니다.
계층적 강화 학습을 위한 확률적 신경망
OpenAI 연구자들은 확률적 신경망과 정보이론적 정규화기를 사용하여 해석 가능한 기술을 사전 훈련하여 희소 보상이 있는 다운스트림 작업에서의 학습 속도를 높이는 프레임워크를 제안합니다.
OpenAI 비지도 학습 감정 뉴런
OpenAI는 아마존 리뷰의 다음 문자를 예측하여 감정 표현을 학습하는 비지도 시스템을 개발했으며, 현저히 적은 라벨 예시로 Stanford Sentiment Treebank에서 최첨단 정확도를 달성했습니다.