OpenAI 우주

OpenAI 우주는 인간처럼 컴퓨터를 사용하도록 AI 에이전트를 훈련시키기 위해 설계된 플랫폼입니다: 화면 픽셀을 관찰하고 가상 키보드와 마우스를 조작함으로써. 다양한 소프트웨어 환경에서 다양한 작업을 제공함으로써, OpenAI는 '좁은 AI'를 넘어 일반 지능으로 나아가려고 합니다. 여기서 단일 에이전트는 과거 경험을 적용하여 unfamiliar하고 어려운 새로운 환경을 maîtr할 수 있습니다.

우주 인프라 및 기술 설계

우주는 에이전트가 원격 데스크톱을 조작할 수 있도록 하는 공통 인터페이스를 사용합니다. 시스템은 에이전트를 환경의 VNC 서버와 상호작용하여 시각 데이터와 입력 명령을 교환하는 VNC 클라이언트로 변환합니다.

성능 및 확장성

고처리량 훈련을 지원하기 위해, OpenAI는 Go로 작성된 배치 지향 VNC 클라이언트를 개발하여 Python의 공유 라이브러리로 로드했습니다. 이 아키텍처는 단일 Python 프로세스가 60프레임/초로 최대 20개의 환경을 병렬로 구동할 수 있게 합니다. 시스템은 routinely 100ms 지연을 유지하며, 그 시간의 대부분은 서버 측 인코딩에 기인합니다.

주요 인프라 속성

  • 범용성: 에이전트는 에뮬레이터가 필요하거나 프로그램의 내부 코드에 접근할 필요 없이 게임, 터미널, 웹 브라우저, CAD 소프트웨어, 스프레드시트 등을 포함한 기존의 모든 컴퓨터 프로그램과 상호작용할 수 있습니다.
  • 인간 중심 인터페이스: 인터페이스가 인간 상호작용(픽셀/키보드/마우스)을 모방하기 때문에, 인간 성능이 기준이 됩니다. 인간 시연은 VNC 트래픽으로 기록되어 강화 학습(RL)으로 전환하기 전에 에이전트를 초기화하기 위한 행동 클로닝에 사용될 수 있습니다.
  • 표준화: VNC 사용은 운영 체제 간에 넓은 호환성을 허용하며, Amazon Mechanical Turk와 같은 서비스를 통해 시연을 수집하기 위해 JavaScript 기반 VNC 구현을 사용할 수 있게 합니다.
  • 관찰 가능성: 환경의 공유 데스크톱에 VNC 클라이언트를 연결하여 실시간으로 훈련을 디버그할 수 있습니다.

지원되는 환경

우주의 각 환경은 픽셀/입력을 위한 VNC 서버와 보상 신호 및 제어 메시지를 위한 WebSocket 서버를 포함하는 Docker 이미지로 패키지됩니다.

Atari 게임

우주는 Arcade Learning Environment의 Atari 2600 게임을 포함합니다.これらは Docker 이미지에서 비동기적으로 실행되어 에이전트가 실제 세계 네트워크 조건을 처리하도록 강제합니다. 로컬 클라우드 네트워크에서는 시스템이 20ms 관찰 지연과 10ms 행동 지연으로 60 FPS를 달성하며, 공용 인터넷에서는これが 80ms 관찰 지연과 30ms 행동 지연으로 20 FPS로 떨어집니다.

Flash 게임

OpenAI는 플랫폼을 확장하기 위해 1,000개의 Flash 게임(보상 기능이 있는 100개)을 통합했습니다.これらのゲーム는 성공 기준에 대한 표준화된 메모리 구조가 없기 때문에, OpenAI는 컨볼루션 신경망 기반 OCR 모델을 개발했습니다.このモデル은 VNC 자기 루프에서 화면 점수를 파싱하여 RL에 대한 보상 신호를 제공합니다.

브라우저 작업

우주는 에이전트가 픽셀과 입력을 사용하여 웹을 탐색하도록 하여, 이메일 관리나 교육 과정 완성과 같은 작업으로 나아가게 합니다.

  • 미니 월드 오브 비츠: 간단한 버튼 클릭에서 복잡한 시뮬레이션된 이메일 회신까지 80개의 환경으로 구성된 벤치마크로, 브라우저 상호작용을 위한 MNIST의 유사물로 설계되었습니다.
  • 실세계 작업: 에이전트는 라이브 서비스를 스팸하지 않기 위해 웹사이트의 캐시된 기록을 사용하여 항공편 예약을 검색하는 것과 같은 현실적인 작업에서 훈련받고 있습니다.

검증 및 성능 결과

변동 지연과 같은 '실 세계의 거친 상황'에도 불구하고 인프라가 학습을 지원할 수 있도록 보장하기 위해, OpenAI는 여러 가지 검증 실험을 수행했습니다.

우주 퐁

gym-core.PongDeterministic-v3 환경을 사용하여, OpenAI는 변동 지연에도 불구하고 에이전트가 정확한 반응을 배울 수 있음을 검증했습니다. 1시간 훈련된 스타터 에이전트는 21점 중 +17점을 달성했으며, 이는 환경의 높은 속도 때문에 평균 -11점을 기록한 인간보다 훨씬 뛰어납니다.

네트워크 지연 분석

공용 인터넷을 통해 에이전트의 평균 반응 시간은 약 150ms(관찰 도착 110ms, 계산 10ms, 행동 효과 30ms)입니다. 이는 평균 인간 반응 시간 250ms보다 빠릅니다. 로컬 네트워크에서는これが 80ms로 떨어지고, 단일 기계 내에서는 40ms로 떨어집니다.

미래 방향 및 커뮤니티 통합

OpenAI는 ImageNet이 컴퓨터 비전을 가속화한 것처럼, 우주가 일반적인 문제 해결 능력을 위한 촉매제가 되기를 원합니다. 미래 계획에는 다음이 포함됩니다:

  • 전송 학습 벤치마크: 에이전트가 작업 간 일반화 능력을 향상시키고 있는지 측정하기 위한 향후 출시.
  • 확장된 통합: 에뮬레이터를 통한 Android 앱, Unity 게임, HTML5 게임, 그리고 Microsoft의 Project Malmo 통합 계획.
  • 커뮤니티 기여: OpenAI는 더 많은 소프트웨어를 패키지할 수 있는 권한을求めており, 에이전트 초기화를 위한 공개 데이터셋을 구축하기 위한 인간 시연도 찾고 있습니다.

Sources