fangvv/VN-MADDPG
Code for paper "基于多智能体深度强化学习的车联网通信资源分配优化"
해결하는 문제
이 프로젝트는 연결된 차량의 인터넷(IoCV)에서 스펙트럼 공유 및 자원 할당 문제를 해결합니다. 특히, 차량 간 통신(V2V) 링크의 전송 전력과 리소스 블록(RB) 선택을 최적화하여 전송 속도와 전체 용량을 향상시키는 것을 목표로 합니다. 이 과정에서 차량 간 인프라 통신(V2I) 링크의 성능을 훼손하지 않으면서, 빠르게 변화하는 채널로 인해 중앙 집중식 관리가 불가능한 고속 이동 도시 환경에서도 효과적인 자원 관리를 실현합니다.
작동 방식
이 프로젝트는 중앙 집중 학습과 분산 실행(CTDE) 프레임워크를 기반으로 한 다중 에이전트 심층 결정론적 정책 기울기(MADDPG) 알고리즘을 구현합니다.
- 에이전트: 각 V2V 링크가 에이전트로 간주됩니다.
- 관측: 에이전트는 리소스 블록에서의 빠른 및 대규모 페이딩, 간섭 수준, 페이로드 상태와 같은 국지적 상태를 관측합니다.
- 행동: 에이전트는 연속 값을 출력하여 리소스 블록을 선택하고 전송 전력 수준을 결정합니다.
- 보상: 전체 V2I 링크 용량과 V2V 전송 성공률을 기반으로 공유 보상을 계산합니다.
- 학습: 학습 중에는 모든 에이전트의 행동을 집계하는 중앙 집중식 크리틱 네트워크를 사용하여 학습을 안정화합니다. 실행 시에는 분산형 액터 네트워크만 사용하므로 차량은 국지적 관측에 기반해 결정을 내릴 수 있습니다.
대상 사용자
차량 네트워크, 무선 통신 자원 할당, 다중 에이전트 강화학습(MARL)을 네트워크 최적화에 적용하는 연구자 및 엔지니어.
주요 특징
- CTDE 프레임워크: 다중 에이전트 환경의 비정상성에 대응하기 위해 중앙 집중 학습을 사용하면서도 분산 실행을 유지합니다.
- 포괄적인 베이스라인: MADQN(이산 행동 공간), 단일 에이전트 DDPG(독립 학습), 무작위 정책을 포함한 성능 비교를 위한 구현이 제공됩니다.
- 현실적인 시뮬레이션: 3GPP TR 36.885 도시 그리드 모델(맨해튼 레이아웃) 기반으로 LOS/NLOS 경로 손실과 샤프팅 페이딩을 시뮬레이션합니다.
- 고급 경험 재생: 세그먼트 트리 기반의 균일 및 우선순위 경험 재생(PER)을 구현하여 효율적인 샘플링을 실현합니다.
관련
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트