OpenAI 로봇 손으로 루빅스 큐브 풀기

OpenAI는 인간과 유사한 로봇 손을 사용하여 루빅스 큐브를 풀 수 있는 시스템을 개발했습니다. 시뮬레이션에서 신경망을 entièrement 훈련시키고 Automatic Domain Randomization(ADR)이라는 새로운 기술을 활용함으로써, 이 시스템은 복잡한 민첩한 조작 기술을 물리적 하드웨어로 전이할 수 있으며, 강화 학습이 높은 자유도를 요구하는 실제 세계 문제를 해결할 수 있음을 보여줍니다.

Automatic Domain Randomization (ADR)

Automatic Domain Randomization(ADR)은 점점 더 어려운 시뮬레이션 환경을 자동으로 생성함으로써 신경망을 시뮬레이션에서 실제 세계로 전이할 수 있게 합니다. 이 접근 방식은 실제 세계의 완벽히 정확한 물리 모델이 필요 없도록 하는데, 로봇 손과 루빅스 큐브와 같은 복잡한 객체에 대해서는 종종 달성하기 불가능합니다.

ADR 작동 방식

ADR은 신경망이 큐브를 푸는 것을 배우는 단일 비랜덤화 환경에서 시작하여 작동합니다. 네트워크가 특정 성능 임계값에 도달하면 시스템은 자동으로 도메인 랜덤화의 양을 증가시킵니다.これによりネットワークはより幅広い条件に一般化するよう強制され、ネットワークが改善されるにつれてこのプロセスが繰り返されます.

랜덤화된 파라미터에는 다음이 포함됩니다:

  • 루빅스 큐브의 크기
  • 큐브의 질량
  • 로봇 손가락의 마찰
  • 손의 시각적 표면 재질

수동 랜덤화 대비 장점

수동 도메인 랜덤화는 인간 전문가가 전이를 방해하지 않으면서도 너무 넓지 않아 학습이 불가능하지 않은 범위를 지정해야 하는 반면, ADR은 인간의 개입 없이 이러한 범위를 자동으로 확장합니다. 블록 뒤집기 작업에서 ADR과 수동 랜덤화를 비교한 테스트에서, ADR은 인간 튜닝 없이 기준 대비 전이 성능을 두 배로 늘렸습니다.

robustness 및 emergent 메타 학습

이 시스템은 훈련 중에 결코 만나지 못한 방해에 대해 매우 강건합니다. 예를 들어 stuffed giraffe로 찌르는 것과 같은 경우입니다. 이러한 강건성은 네트워크가 환경에 배치될 때 행동을 빠르게 적응시킬 수 있는 일반적인 학습 알고리즘을 학습하는 emergent 메타 학습에 기인합니다.

적응 테스트

OpenAI는 시뮬레이션에서 큐브 뒤집기의 "성공까지의 시간"을 측정하여 이 가설을 테스트했습니다. 네트워크의 메모리 리셋, 동역학 리셋, 또는 관절 파손과 같은 방해가 적용될 때, 성공까지의 시간은 inicialmente 증가했지만 네트워크가 재학습하고 새로운 조건에 적응함에 따라 기준선으로 다시 감소했습니다.

신경망 해석 가능성

해석 가능성 툴박스의 비음수 행렬 분해를 사용하여 OpenAI는 네트워크의 메모리를 시각화했습니다. 고차원 벡터는 여섯 개의 색상 코드 그룹으로 축소되었습니다. 분석 결과 각 메모리 그룹은 의미 있는 행동에 해당하며, 연구자들은 행동이 실제로 발생하기 전에 네트워크가 큐브를 스핀하거나 얼굴을 시계 방향으로 회전하려고 하는지 여부를 식별할 수 있게 했습니다.

성능 및 과제

시스템은 어떤 초기 조건에서도 루빅스 큐브를 풀 수 있지만, 스크램블의 복잡성에 따라 성공률에 도전이 있습니다:

  • 최대 난이도 스크램블 (26면 회전): 20% 성공률.
  • 더 간단한 스크램블 (15회전): 60% 성공률.

실패는 일반적으로 처음 몇 번의 면 회전과 플립 중에 발생하며, 이때 네트워크는 큐브를 동시에 풀고 실제 세계의 물리적 특성에 적응해야 합니다. 큐브가 떨어지면, 네트워크는 큐브가 손에 다시 놓일 때 풀기를 계속할 수 있습니다.

개발 경로 및 프로토타입

문제를 관리하기 위해 OpenAI는 일반 루빅스 큐브로 이동하기 전에 맞춤형 큐브 프로토타입 시리즈를 디딤돌로 활용했습니다:

프로토타입 위치 + 방향 내부 자유도 (센서)
Locked cub Vision 0 센서 없음
Face cub PhaseSpace 2 PhaseSpace
Full cube PhaseSpace 6 PhaseSpace
Giiker cube Vision 6 내장 센서
일반 루빅스 큐브 Vision 6 비전

회전 대칭을 깨기 위해 일반 루빅스 큐브의 각 센터 큐블렛 스티커의 작은 부분을 잘라냈습니다.

Sources