fangvv/UAV-DDPG
Code for paper "Computation Offloading Optimization for UAV-assisted Mobile Edge Computing: A Deep Deterministic Policy Gradient Approach"
해결하는 문제
이 프로젝트는 UAV 지원 모바일 엣지 컴퓨팅(MEC) 시스템에서 계산 오프로딩을 최적화하기 위한 강화학습 접근법을 구현합니다. 동적이고 통제 불가능한 환경에서 사용자 장치(UE)의 최대 처리 지연을 최소화하기 위해 사용자 스케줄링, 작업 오프로딩 비율, UAV의 비행 각도 및 비행 속도를 종합적으로 최적화합니다.
작동 방식
시스템은 고차원 상태 공간과 연속 행동 공간을 처리하기 위해 Deep Deterministic Policy Gradient(DDPG) 알고리즘을 사용합니다.
- 환경 시뮬레이션: 사용자 정의 시뮬레이터가 3D 영역, 채널 대역폭, UAV 배터리, UE 위치를 모델링합니다. 전송 및 계산 시간을 기반으로 LOS(직선 시야) 및 NLOS(직선 시야 없음) 채널 조건을 고려하여 처리 지연을 계산합니다.
- DDPG 에이전트: Actor-Critic 아키텍처를 사용합니다. Actor 네트워크는 최적의 행동(대상 UE, 비행 각도, 거리, 오프로딩 비율)을 결정하고, Critic 네트워크는 해당 행동의 Q값을 평가합니다.
- 상태 정규화: 배터리 수준 및 좌표와 같은 원시 상태 데이터는 [0, 1] 범위로 스케일링되어 학습의 안정성과 수렴 속도를 향상시킵니다.
- 베이스라인: DQN(행동 공간을 이산화한 경우)과 Actor-Critic의 구현을 포함하여 성능 비교가 가능합니다.
대상 사용자
무선 통신, UAV 지원 엣지 컴퓨팅, 모바일 네트워크에서의 리소스 할당을 위한 딥 강화학습 응용에 종사하는 연구자 및 엔지니어.
주요 특징
- 통합 최적화: 비행 궤적과 작업 오프로딩 비율을 동시에 관리합니다.
- 연속 행동 공간: DDPG를 사용하여 행동을 이산화하는 제약을 피합니다.
- 아블레이션 스터디: 상태 정규화 및 탐색 노이즈의 영향을 테스트하기 위한 특정 코드 버전을 포함합니다.
- 포괄적인 베이스라인: DQN 및 기본 Actor-Critic 방법과의 직접 비교를 제공합니다.
관련
- 프로젝트
- Dispatch
- Dispatch
- Dispatch