복잡한 목표 학습을 위한 OpenAI 반복 증폭
OpenAI는 작업을 더 간단한 하위 작업으로 분해하여 훈련 신호를 생성함으로써 인간 수준을 초과하는 복잡한 목표를 명시할 수 있는 AI 안전 기술인 반복 증폭을 제안합니다.
OpenAI Scholars 2019 프로그램 발표
OpenAI는 두 번째 코호트인 OpenAI Scholars 프로그램의 지원을 시작했으며, 소수자 그룹에 속한 개인들에게 장학금과 멘토십을 제공하여 딥러닝을 공부하고 오픈소스 프로젝트를 진행하도록 지원합니다.
OpenAI 펠로우 겨울 2019 및 인턴 여름 2019 프로그램
OpenAI는 다양한 배경을 가진 연구자와 학생들을 AI 연구에 통합하기 위해 겨울 2019 펠로우 프로그램과 여름 2019 인턴십의 지원을 시작했다고 발표했습니다.
FFJORD: 확장 가능한 가역 생성 모델을 위한 자유형 연속 동역학
OpenAI는 Hutchinson의 트레이스 추정기를 사용하여 확장 가능한 밀도 추정을 위해 제한 없는 신경망 아키텍처를 가능하게 하는 연속 시간 가역 생성 모델인 FFJORD를 소개합니다.
OpenAI Scholars 2018 최종 프로젝트
OpenAI는 2018 Scholars 프로그램의 최종 프로젝트들을 소개하는 쇼케이스를 발표했으며, 음악 생성, 직관적 물리학, 자연어 처리 등 다양한 머신러닝 응용 사례를 선보였습니다.
OpenAI Five: 2018 인터내셔널 결과
OpenAI Five는 2018 인터내셔널에서 세계 최고 수준의 프로 Dota 2 선수들과 경쟁했으며, 'Real Dota' 규칙 하에서 두 경기 모두 패했음에도 불구하고 높은 수준의 게임플레이를 보여주었습니다.
OpenAI 대규모 호기심 기반 학습 연구
OpenAI 연구원들은 예측 오류에 기반한 내재 호기심 보상만으로 훈련된 에이전트가 54개의 벤치마크 환경에서 손으로 설계된 외재 보상 없이도 높은 성능을 달성할 수 있음을 입증했습니다.
OpenAI Five 벤치마크 결과
OpenAI Five는 99.95번째 백분위수 Dota 플레이어 팀과의 3전 2선승제 시리즈에서 승리했으며, 복잡성과 불확실성을 다루는 고급 AI 역량을 보여줍니다.
OpenAI Dactyl: 도메인 랜덤화를 통한 손재주 학습
OpenAI는 인간과 유사한 로봇 손을 시뮬레이션에서 훈련시켜 물리적 물체를 높은 손재주로 조작하고, 별도의 미세 조정 없이 실제 세계로 그 기술을 전이하는 시스템인 Dactyl을 개발했습니다.
OpenAI 변분 옵션 발견 알고리즘
OpenAI는 변분 자동인코딩 옵션 학습(VALOR)과 커리큘럼 학습 접근법을 도입하여 강화 학습 에이전트에서 다양한 행동 모드의 발견을 안정화합니다.
OpenAI Scholars 2018: 우리 장학금을 만나보세요
OpenAI는 2018년 Scholars 코호트를 소개했으며, 강화 학습, 언어 모델링, AI와 예술의 교차점 등 다양한 분야에 집중하는 연구자들로 구성된 다채로운 그룹을 특징으로 합니다.
OpenAI Five 벤치마크
OpenAI는 OpenAI Five를 위한 벤치마크 매치를 발표했으며, 확장된 영웅 풀과 업데이트된 게임 메커니즘을 통해 AI를 고백분위수 인간 플레이어와 테스트합니다.
Glow: 더 나은 가역 생성 모델
OpenAI는 가역 1x1 컨볼루션을 사용하여 고해상도 이미지를 생성하고 정확한 잠재 변수 추론 및 효율적인 샘플링을 제공하는 flow 기반 생성 모델인 Glow를 소개합니다.
단일 시연을 통한 Montezuma’s Revenge 학습
OpenAI는 단일 인간 시연을 사용해 시작 상태의 역 커리큘럼을 만들어 Montezuma’s Revenge에서 기록적인 74,500점의 높은 점수를 달성하도록 RL 에이전트를 훈련시켰습니다.
OpenAI Five
OpenAI Five, Dota 2에서 자체 플레이로 훈련된 다섯 개의 신경망 팀은 아마추어 인간 팀을 이기기 시작했으며, 기본적인 알고리즘 발전 없이 장시간 horizon, 부분적으로 관측되는 작업을 처리할 수 있는 확장된 강화 학습을 보여주었습니다.
OpenAI 레트로 콘테스트 결과
OpenAI는 첫 번째 레트로 콘테스트를 마무리했으며, Sonic the Hedgehog을 위한 최고 성능 AI 에이전트는 PPO와 Rainbow DQN과 같은 기존 알고리즘을 튜닝하거나 확장하여 개발되었습니다.
다중 에이전트 시스템에서 OpenAI 학습 정책 표현
OpenAI는 에이전트 모델링을 표현 학습 문제로 다루어 최소한의 상호작용 데이터만으로 다중 에이전트 시스템에서 에이전트 행동을 이해할 수 있는 일반 학습 프레임워크를 소개합니다.
OpenAI 비지도 학습을 통한 언어 이해 향상
OpenAI는 비지도 언어 모델링으로 사전 학습한 후 소규모 지도 데이터셋으로 미세 조정한 Transformer 기반 모델이 상식 추론을 포함한 다양한 언어 작업에서 최첨단 결과를 달성할 수 있음을 보여주었습니다.
GamePad: 정리 증명을 위한 학습 환경
OpenAI는 Coq 증명 보조기 내에서 정리 증명에 머신러닝 방법을 적용하여 전술 예측 및 위치 평가를 자동화하도록 설계된 시스템인 GamePad를 소개했습니다.
OpenAI 펠로우 프로그램 2018 가을
OpenAI는 2018년 가을에 펠로우 프로그램을 시작하여 정식 AI 배경이 없는 개인들이 인공지능 연구로 전환할 수 있는 경로를 제공했습니다.
OpenAI Gym Retro 릴리스
OpenAI는 에이전트 일반화 연구를 가능하게 하기 위해 여러 클래식 콘솔에 걸쳐 1,000개가 넘는 타이틀로 게임 라이브러리를 확장한 강화 학습 플랫폼인 Gym Retro의 전체 버전을 출시했습니다.
OpenAI AI 및 컴퓨팅 분석
OpenAI 분석에 따르면, 가장 큰 AI 훈련 실행에 사용된 컴퓨팅이 2012년 이후 지수적으로 증가했으며, 3.4개월마다 두 배가 되어 모어의 법칙을 크게 앞서고 있습니다.
토론을 통한 AI 안전
OpenAI는 AI 에이전트가 토론하도록 훈련하는 안전 기법을 제안하여, 인간이 인지 능력을 넘어서는 작업을 수행하는 시스템을 감독할 수 있게 합니다.
OpenAI 진화된 정책 그라디언트 (EPG)
OpenAI는 손실 함수를 진화시켜 RL 에이전트가 작업군 내 새로운 작업에 일반화하도록 돕는 메타러닝 접근법인 Evolved Policy Gradients (EPG)를 소개합니다.
OpenAI Gotta Learn Fast 벤치마크
OpenAI는 Sonic the Hedgehog 비디오 게임 프랜차이즈를 기반으로 한 새로운 강화 학습 벤치마크를 도입하여 전이 학습 및 few-shot 학습 성능을 측정합니다.
OpenAI 레트로 콘테스트 및 Gym Retro 출시
OpenAI는 보지 못한 비디오 게임 레벨에서 강화 학습 일반화를 측정하기 위해 레트로 콘테스트를 시작하고, 30개의 SEGA Genesis와 62개의 Atari 2600 게임을 Gym에 통합한 플랫폼인 Gym Retro를 출시했습니다.
OpenAI 행동 의존형 인수분해 베이스라인을 활용한 정책 그래디언트 분산 감소
OpenAI 연구원들은 정책 그래디언트 방법을 위한 편향 없는 행동 의존형 베이스라인을 개발하여 그래디언트 추정 분산을 감소시키고, 고차원 행동 공간에서 더 빠른 학습을 가능하게 했습니다.
OpenAI OT-GAN: 최적 전송을 이용한 GAN 개선
OpenAI는 새로운 미니배치 에너지 거리 측정값을 사용하여 훈련 안정성과 이미지 생성 품질을 향상시키는 생성적 적대 신경망 변형인 Optimal Transport GAN (OT-GAN)을 소개합니다.
OpenAI 해커톤 보고서 2018년 3월
OpenAI는 2018년 3월 3일에 첫 해커톤을 개최하여 100명의 AI 커뮤니티 구성원을 모아 헬스케어, 안전, 강화 학습에 걸친 프로젝트를 개발했습니다.
1차 메타러닝 알고리즘에 대하여
OpenAI는 Reptile이라는 1차 메타러닝 알고리즘을 소개합니다. 이 알고리즘은 파라미터 초기값을 최적화함으로써 2차 미분 없이도 에이전트가 새로운 작업을 빠르게 학습할 수 있게 합니다.
OpenAI Reptile: 확장 가능한 메타러닝 알고리즘
OpenAI는 동일 작업의 서로 다른 미니배치 그라디언트 간 내적을 최대화함으로써 모델이 소수의 예시만으로 일반화할 수 있게 하는 확장 가능한 메타러닝 알고리즘 Reptile을 소개했습니다.
OpenAI 장학 프로그램
OpenAI는 소수자 그룹에 속한 개인들에게 장학금과 멘토링을 제공하여 딥러닝을 공부하고 프로젝트를 오픈소스화할 수 있도록 OpenAI Scholars 프로그램을 시작했습니다.
OpenAI 연구: 메타 강화 학습을 통한 탐색 학습
OpenAI 연구원들은 복잡한 환경에서 탐색 성능을 향상시키기 위해 설계된 두 가지 메타 강화 학습 알고리즘인 E-MAML과 E-RL²를 소개했습니다.
OpenAI 로봇 연구를 위한 재료
OpenAI는 복잡한 조작 작업에서 희소 보상으로부터 강화 학습을 가능하게 하기 위해 여덟 개의 시뮬레이션 로봇 환경과 Baselines 구현의 Hindsight Experience Replay (HER)를 공개했습니다.
OpenAI 멀티-목표 강화 학습 로봇 환경
OpenAI는 연구를 진전시키기 위해 OpenAI Gym과 통합된 도전적인 연속 제어 로봇 작업 세트를 출시했습니다.
OpenAI 해커톤 2018년 3월
OpenAI는 AI 학습과 프로젝트 개발을 장려하기 위해 2018년 3월 3일 샌프란시스코에서 커뮤니티 해커톤과 일련의 강연을 개최했습니다.
OpenAI 후원자 및 조직 업데이트
OpenAI는 새로운 후원자, 고문 임명, 그리고 테슬라의 AI 집중과 관련된 잠재적 갈등을 피하기 위해 엘론 머스크의 이사회 퇴임을 발표했습니다.
OpenAI, 악의적인 AI 사용에 대비 중
OpenAI와 파트너들은 악의적인 행위자가 AI를 악용할 수 있음을 예측하고 이러한 글로벌 보안 위협을 완화하기 위한 권장 사항을 제시하는 연구 논문을 발표했습니다.
OpenAI 가르침을 통한 해석 가능한 머신 러닝
OpenAI는 교사-학생 신경망 프레임워크를 활용하여 개념의 가장 설명적인 예시를 식별하는 머신 교수법을 도입하여, 결과 해석이 임의적이지 않고 인간에게 해석 가능하도록 보장합니다.
OpenAI 엔티티 디스암비게이션을 위한 타입 발견
OpenAI는 자동으로 발견된 타입에 대한 소속을 예측하기 위해 신경망을 사용하는 시스템을 개발하여 CoNLL 및 TAC KBP 2010 데이터셋에서 엔티티 디스암비게이션 정확도를 향상시켰습니다.
OpenAI 연구 요청 2.0
OpenAI는 커뮤니티 기여를 장려하기 위해 강화 학습과 기계 학습 분야의 미해결 기술 문제 일곱 가지로 구성된 Requests for Research 2.0을 발표했습니다.
2,500 노드로 Kubernetes 확장
OpenAI는 딥러닝 연구를 위해 Azure에서 Kubernetes 클러스터를 2,500 노드로 확장하기 위해 필요한 기술적 최적화를 설명하며, etcd, 네트워킹, 이미지 풀에서의 병목 현상을 해결합니다.
OpenAI 블록-스파스 GPU 커널
OpenAI는 블록-스파스 신경망 아키텍처용으로 고도로 최적화된 GPU 커널을 출시하여, 모델을 더 넓고 깊게 만들면서 cuBLAS 또는 cuSPARSE보다 주문 단위 이상 빠른 속도로 실행할 수 있게 했습니다.
OpenAI, L0 정규화를 통한 희소 신경망 학습
OpenAI는 신경망에서 L0 노름 정규화를 이용해 가중치를 정확히 0으로 만들 수 있는 확률 게이트를 사용함으로써 훈련 속도, 추론 속도 및 일반화를 향상시키는 희소 모델을 만드는 방법을 소개합니다.
OpenAI 해석 가능하고 교육적인 예시 연구
OpenAI 연구진은 교사와 학생 신경망을 공동 훈련이 아닌 반복적으로 훈련시킴으로써 해석 가능한 교육 전략을 생성하며, 이는 AI와 인간 모두에게 효과적으로 가르칠 수 있음을 보여준다.
OpenAI 계층 학습 연구
OpenAI는 Meta-Learning Shared Hierarchies(MLSH)라고 하는 강화 학습 알고리즘을 개발하여 고수준 행동을 자동으로 발견함으로써 브루트포스 방법보다 복잡하고 장기 과제를 더 효율적으로 해결할 수 있게 했습니다.
OpenAI 시뮬레이션에서 일반화하기
OpenAI는 동역학 및 도메인 랜덤화 기술을 사용하여 시뮬레이션에서 로봇 컨트롤러를 훈련시켜 물리적 로봇에 일반화하고 계획되지 않은 환경 변화에 반응할 수 있도록 하였다.
OpenAI 동적 랜덤화를 이용한 로봇 제어의 시뮬레이션에서 실제 세계로의 전이
OpenAI 연구진은 시뮬레이션에서 전용으로 훈련된 로봇 제어 정책이 추가적인 물리적 훈련 없이 실제 세계 하드웨어로 전이될 수 있도록 하는 동적 랜덤화 방법을 개발했습니다.
OpenAI 비대칭 액터-크리틱 이미지 기반 로봇 학습
OpenAI는 시뮬레이터의 전체 상태에서 크리틱을 훈련시키고 액터는 오직 RGBD 이미지에만 의존하도록 함으로써 로봇 학습을 개선하는 비대칭 액터-크리틱 프레임워크를 도입하여 실제 세계 데이터 없이 효율적인 시뮬레이션-실제 전이를 가능하게 합니다.
OpenAI 도메인 랜덤화 및 생성 모델을 이용한 로봇 잡기
OpenAI는 도메인 랜덤화와 자기회귀 모델을 사용하는 데이터 생성 파이프라인을 개발하여, 오직 시뮬레이션 훈련 데이터만을 사용해 보지 못한 객체에 대한 실제 세계 잡기 성공률 80%를 달성했습니다.