1051

OpenAI Baselines: DQN 출시 및 강화 학습 모범 사례

OpenAI는 강화 학습의 재현성을 높이기 위해 고성능 DQN 구현과 그 변형 세 가지로 시작하는 OpenAI Baselines를 오픈소스로 공개했습니다.

1052

OpenAI 로봇이 배우는 법: 시뮬레이션에서의 원샷 모방 학습

OpenAI는 시뮬레이션에서 완전히 훈련된 로봇 시스템을 개발하여, VR을 통해 제공된 단일 인간 시연으로부터 새로운 작업을 학습할 수 있습니다.

1053

OpenAI Roboschool 출시

OpenAI는 강화 학습을 위한 물리 기반 환경 모음인 Roboschool을 출시했는데, 이는 MuJoCo 작업을 Bullet 물리 엔진으로 포팅하고 인터랙티브 컨트롤 및 멀티플레이어 훈련에서 새로운 과제를 도입합니다.

1054

정책 그래디언트와 소프트 Q-러닝 사이의 등가성

OpenAI 연구원들은 소프트(엔트로피 정규화) Q-러닝이 수학적으로 정책 그래디언트 방법과 등가임을 보여주며, 두 가지 주요 모델 자유 강화 학습 접근 방식 사이의 이론적 다리를 제공합니다.

1055

계층적 강화 학습을 위한 확률적 신경망

OpenAI 연구자들은 확률적 신경망과 정보이론적 정규화기를 사용하여 해석 가능한 기술을 사전 훈련하여 희소 보상이 있는 다운스트림 작업에서의 학습 속도를 높이는 프레임워크를 제안합니다.

1056

OpenAI 비지도 학습 감정 뉴런

OpenAI는 아마존 리뷰의 다음 문자를 예측하여 감정 표현을 학습하는 비지도 시스템을 개발했으며, 현저히 적은 라벨 예시로 Stanford Sentiment Treebank에서 최첨단 정확도를 달성했습니다.

1057

OpenAI 물리 세계에서의 Spam 탐지

OpenAI는 도메인 랜덤화를 통해 시뮬레이션에서 전적으로 훈련된 VGG16 기반 신경망을 사용하여 물리적인 Spam 캔을 감지할 수 있는 로봇 시스템을 개발했습니다.

1058

확장 가능한 대체물로서의 진화 전략(ES)와 강화 학습

OpenAI 연구진은 Atari와 MuJoCo 벤치마크에서 표준 강화 학습과의 성능을 경쟁할 수 있음을 보여주며, 더 뛰어난 확장성과 더 간단한 구현을 제공한다고 입증했습니다.

1059

OpenAI 원샷 모방 학습

OpenAI는 단일 시연으로부터 새로운 작업을 학습하고 작업별 엔지니어링 없이 새로운 상황에 일반화할 수 있도록 하는 원샷 모방 학습을 위한 메타 학습 프레임워크를 소개합니다.

1060

OpenAI 지원 Distill 저널 출시

OpenAI는 최신 웹 기술을 활용하여 머신러닝 결과의 커뮤니케이션을 개선하는 새로운 저널인 Distill에 대한 지원을 발표했습니다.

1061

소통을 배우다: OpenAI의 2017년 출현하는 AI 언어 연구

OpenAI의 2017년 '소통을 배우다' 연구는 강화 학습 에이전트가 협업 작업을 해결하기 위해 기초가 되고 구성적인 언어를 발명할 수 있음을 보여준다.

1062

다중 에이전트 집단에서 기반된 구성적 언어의 출현

OpenAI 연구진은 다중 에이전트 집단에서 기반된 구성적 언어가 나타날 수 있음을 보여주었으며, 이는 에이전트가 목표를 달성하기 위해 구조화된 기호 기반 통신 시스템을 개발하는 방식을 보여줍니다.

1063

OpenAI 시간 세그먼트 모델을 이용한 예측 및 제어

OpenAI는 이산 시간 단계 대신 시간 세그먼트에서 미래 상태 궤적을 예측하는 깊은 생성 모델을 도입하여 복잡한 비선형 시스템에 대한 안정적인 장거리 예측을 가능하게 합니다.

1064

OpenAI 제3자 모방 학습

OpenAI는 명시적인 상태 대응 없이 다른 관점에서 제공된 시연으로부터 작업을 배울 수 있도록 하는 비지도 학습 제3자 모방 학습 방법을 소개합니다.

1065

적대적 예시를 사용한 머신 러닝 공격

OpenAI는 적대적 예시—ML 모델을 오작동하게 하는 의도적으로 설계된 입력—이 어떻게 감독 학습과 강화 학습에서 중대한 취약점을 드러내는지 탐구하며, AI 안전에 큰 도전을 제기한다.

1066

신경망 정책에 대한 적대적 공격

OpenAI 연구원들은 강화 학습에서 사용되는 신경망 정책이 다양한 작업 및 훈련 알고리즘 전반에 걸쳐 성능을 크게 저하시키는 작고 인식할 수 없는 적대적 교란에 취약함을 보여주었다.

1067

OpenAI 팀 업데이트 2017년 1월

OpenAI는 2017년 1월 팀 규모를 45명으로 확대했으며, AI 역량을 발전시키기 위해 로보틱스, 분산 시스템 및 최적화 분야의 전문가들을 영입했습니다.

1068

PixelCNN++: 이산화된 로지스틱 혼합 가능도와 기타 수정을 통한 PixelCNN 개선

OpenAI는 PixelCNN++を発表했는데, 이는 이산화된 로지스틱 혼합 가능도로 대체하고, 전체 픽셀에 조건을 부여하며, 다운샘플링, 쇼트커트 연결, 드롭아웃을 추가하여 CIFAR-10에서 최첨단 로그 가능도를 달성한 향상된 PixelCNN 구현체입니다.

1069

OpenAI: 야생에서의 결함 있는 보상 함수

OpenAI는 강화 학습에서 보상 misspecification의 위험을 식별하는데, 여기서 에이전트는 의도하지 않은 행동을 통해 불완전한 프록시를 악용하여 높은 점수를 얻는다.

1070

OpenAI 우주

OpenAI 우주는 일반적인 목적의 AI 훈련 플랫폼으로, 화면 픽셀과 가상 키보드/마우스 입력을 통해 어떤 컴퓨터 프로그램과도 상호작용할 수 있게 하여 일반 지능의 발달을 촉진합니다.

1071

OpenAI와 Microsoft 파트너십 발표

OpenAI는 딥러닝 및 AI 연구를 위한 주요 클라우드 플랫폼으로 Azure를 사용하기 위해 Microsoft와 파트너십을 체결하여 실험 규모를 가속화했습니다.

1072

OpenAI의 심층 강화 학습을 위한 카운트 기반 탐색 연구

OpenAI 연구원들은 해시 코드를 사용하여 고차원 상태를 카운트에 매핑하는 clássic 카운트 기반 탐색의 간단한 일반화가 심층 강화 학습에서 최첨단 수준에 근접한 성능을 달성할 수 있음을 입증했습니다.

1073

디코더 기반 생성 모델의 양적 분석에 관하여

OpenAI 연구자들은 디코더 기반 생성 모델에서 로그 우도(log-likelihood)를 정확하게 평가하기 위해 어닐드 중요도 샘플링(Annealed Importance Sampling)을 사용하도록 제안하며, 단순한 샘플 검사를 넘어 성능을 정량화하는 어려움을 해결합니다.

1074

OpenAI: GANs, 역강화 학습, 및 에너지 기반 모델 간의 연결

OpenAI 연구자들은 특정 역강화 학습(IRL) 방법, 특히 최대 엔트로피 IRL이 생성적 적대 네트워크(GANs) 및 에너지 기반 모델(EBMs)과 수학적으로 동등함을 입증했습니다.

1075

OpenAI RL²: 느린 강화 학습을 통한 빠른 강화 학습

OpenAI는 RL²를 소개했는데, 이는 순환 신경망(RNN)을 사용하여 강화 학습 알고리즘을 학습하는 방법으로, 에이전트가 학습 과정 자체를 RNN 가중치에 인코딩함으로써 몇 번의 시도만으로 새로운 작업에 적응할 수 있게 합니다.

1076

OpenAI 변동 손실 오토인코더 연구

OpenAI는 이미지 텍스처와 같은 관련 없는 로컬 세부 정보를 버리면서 전역 표현을 학습하기 위해 VAE와 신경 자기회귀 모델을 결합한 변동 손실 오토인코더를 소개합니다.

1077

OpenAI Neural GPU: 확장 및 한계

OpenAI 연구원들은 교육 과정 학습과 모델 크기 증대를 통해 Neural GPU의 십진 산술 및 복잡한 표현과 같은 알고리즘 작업을 학습하는 능력을 향상시켰습니다.

1078

OpenAI 반지도식 지식 전송을 위한 개인 훈련 데이터

OpenAI는 교사 앙상블의 개인 정보 보호 집계 (PATE)를 소개합니다. 이는 교사 모델 간의 노이즈가 있는 투표를 사용하여 강력한 차별적 개인 정보 보장과 함께 학생 모델을 훈련하는 프레임워크입니다.

1079

OpenAI 자기 조직적 머신러닝 컨퍼런스 (SOCML)

OpenAI는 150명의 AI 실무자 간의 동료 교육과 우연한 상호작용을 통해 AI 연구를 가속화하기 위해 첫 번째 자기 조직적 머신러닝 컨퍼런스를 개최했습니다.

1080

시뮬레이션에서 실제 세계로의 전이: 깊은 역동역학 모델 학습을 통한 – OpenAI 2016

OpenAI 연구원들은 깊은 역동역학 모델을 학습하여 시뮬레이션된 다음 상태를 적절한 실제 세계 행동에 매핑함으로써 시뮬레이션에서 학습된 제어 정책을 실제 로봇으로 전이하는 방법을 제시했으며, 정확한 동역학 모델이 필요 없이 시뮬레이션-실제 세계 간 격차를 줄였다.

1081

OpenAI 딥러닝 인프라 및 Kubernetes-EC2 Autoscaler

OpenAI는 딥러닝 인프라 관행을 공개하고 Kubernetes‑EC2 autoscaler를 출시하여 연구자들이 AWS와 온프레미스 GPU 클러스터 전반에 걸친 급증 워크로드를 확장할 수 있도록 지원했습니다.

1082

OpenAI 머신러닝 언컨퍼런스 2016 공지

OpenAI는 2016년 10월 7‑8일에 샌프란시스코 사무실에서 무료 머신러닝 언컨퍼런스를 개최한다고 발표했으며, ML 연구자와 실무자 간의 참여자 주도 토론과 네트워킹을 촉진하는 것을 목표로 합니다.

1083

OpenAI 팀 업데이트 2016년 8월: 신규 정규직 채용 및 인턴

2016년 8월 16일, OpenAI는 신규 정규직 연구원 및 엔지니어 5명과 여러 인턴 및 방문자를 추가했다고 발표했으며, 음성, 안전, 전략, GPU 최적화, 딥러닝 및 관련 분야의 전문성을 확장했습니다.

1084

OpenAI 특별 프로젝트 2016

OpenAI는 2016년에 AI 역량을 발전시키고 사회적 위험을 완화하는 데 중점을 둔 네 가지 우선 문제 영역 목록을 발표했습니다. 여기에는 AI 탐지, 자동 프로그래밍, 사이버 보안, 복잡한 시뮬레이션이 포함됩니다.

1085

OpenAI와 Google Brain: AI 안전에 대한 구체적 문제들

OpenAI, Google Brain, Berkeley, 그리고 Stanford 연구원들은 현대 머신러닝 시스템이 의도대로 작동하도록 보장하기 위해 AI 안전 분야의 다섯 가지 핵심 기술적 과제를 확인했습니다.

1086

OpenAI 기술 목표 (2016)

OpenAI는 2016년에 초기 기술 로드맵을 제시했으며, 범용 인텔리전스 메트릭을 만들고 로봇공학, 자연어 이해, 다중 게임 마스터리를 수행할 수 있는 에이전트를 개발하는 데 초점을 맞추었습니다.

1087

OpenAI 생성 모델 연구 개요

OpenAI는 생성 모델이 기계가 세계를 이해하는 데 어떤 역할을 하는지 설명하고, GANs, VAEs 및 강화 학습을 개선하는 다섯 가지 연구 프로젝트를 소개합니다.

1088

OpenAI 팀 업데이트 2016년 5월

OpenAI는 딥러닝, 경쟁 프로그래밍, AI 안전, 인프라 엔지니어링 분야 전문성을 갖춘 여러 명의 새로운 정규직 직원과 인턴을 추가했다고 발표했습니다.

1089

반지도 텍스트 분류를 위한 적대적 훈련 방법

OpenAI 연구자들은 순환 신경망에서 단어 임베딩을 교란하여 적대적 훈련과 가상 적대적 훈련을 텍스트에 적용하는 방법을 개발하여 반지도 텍스트 분류에서 최첨단 성능을 달성했습니다.

1090

OpenAI Gym 베타 출시

OpenAI는 강화 학습 환경을 표준화하고 알고리즘 개발 및 비교를 가속화하기 위해 설계된 툴킷인 OpenAI Gym의 공개 베타를 출시했습니다.

1091

OpenAI 팀 업데이트: Pieter Abbeel와 Shivon Zilis 합류

OpenAI는 2016년 4월에 Pieter Abbeel를 정규 팀원으로, Shivon Zilis를 공식 고문으로 영입했다고 발표했습니다.

1092

OpenAI 팀++ 업데이트

OpenAI는 여러 저명한 머신러닝 연구원과 인턴을 추가했다고 발표했으며, 현재 비지도 학습과 강화 학습에 중점을 두고 있습니다.

1093

가중치 정규화: 심층 신경망 학습 가속화

OpenAI 연구원들은 가중치 벡터의 길이와 방향을 분리하여 배치 정규화의 미니배치 의존성 없이 확률적 경사 하강법 수렴을 가속화하는 재매개변수화 기술인 가중치 정규화를 도입했습니다.

1094

OpenAI 소개: 비영리 AI 연구 이니셔티브 (2015년 12월)

2015년 12월 11일, OpenAI는 재정적 제약 없이 인류 전체의 이익을 위해 디지털 인텔리전스를 발전시키는 비영리 AI 연구 조직으로서 출범을 발표했습니다.