Farama-Foundation/MO-Gymnasium
Multi-objective Gymnasium environments for reinforcement learning
해결하는 문제
다중 목적 강화 학습(MORL) 알고리즘을 개발하고 비교할 수 있는 표준화된 방법을 제공합니다. 이전까지 연구자들은 단일 스칼라 값이 아닌 다중 보상 신호를 동시에 처리할 수 있는 일관된 API와 벤치마크 환경이 필요했지만, 이를 충족하는 도구가 부족했습니다.
작동 방식
MO-Gymnasium은 표준 Gymnasium API를 확장합니다. 환경과의 상호작용 구조는 동일하게 유지하지만, 보상 시스템을 수정합니다. step 함수는 단일 숫자를 반환하는 대신, numpy 배열 형태의 벡터화된 보상을 반환합니다. 또한 LinearReward 래퍼를 포함하여, 가중치를 사용해 다중 보상을 선택적으로 단일 스칼라 값으로 변환할 수 있습니다.
대상 사용자
다중 목적 강화 학습에 종사하는 연구자 및 개발자로, 표준 환경을 기준으로 알고리즘을 벤치마크하고 테스트할 수 있는 신뢰할 수 있는 도구 키트가 필요한 분들입니다.
주요 특징
- 다중 목적 강화 학습을 위한 표준화된 API.
- MORL 문헌에서 얻은 다양한 환경과 MuJoco와 같은 전통적 환경의 다중 목적 버전 포함.
- 연구 재현성을 보장하기 위한 엄격한 환경 버전 관리.
- Gymnasium API 패턴과 호환됩니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트