fangvv/UAV-DDPG

Code for paper "Computation Offloading Optimization for UAV-assisted Mobile Edge Computing: A Deep Deterministic Policy Gradient Approach"

解决的问题

本项目实现了一种强化学习方法,用于优化UAV辅助的移动边缘计算(MEC)系统中的计算卸载。旨在通过联合优化用户调度、任务卸载比例、UAV的飞行角度和飞行速度,在动态且不可控的环境中最小化用户设备(UE)的最大处理延迟。

工作原理

系统使用深度确定性策略梯度(DDPG)算法来处理高维状态空间和连续动作空间。

  • 环境模拟:自定义模拟器建模3D区域、信道带宽、UAV电池和UE位置。基于传输时间和计算时间计算处理延迟,考虑视距(LOS)和非视距(NLOS)信道条件。
  • DDPG智能体:采用Actor-Critic架构。Actor网络决定最优动作(目标UE、飞行角度、距离和卸载比例),Critic网络评估这些动作的Q值。
  • 状态归一化:原始状态数据(如电池电量和坐标)被缩放到[0, 1]范围,以稳定训练并加速收敛。
  • 基线对比:项目包含DQN(使用离散化动作空间)和Actor-Critic的实现,用于性能比较。

适用对象

从事无线通信、UAV辅助边缘计算以及深度强化学习在移动网络资源分配中应用的研究人员和工程师。

亮点

  • 联合优化:同时管理飞行轨迹和任务卸载比例。
  • 连续动作空间:使用DDPG避免动作离散化带来的限制。
  • 消融研究:包含特定代码版本,用于测试状态归一化和探索噪声的影响。
  • 全面基线:提供与DQN和基础Actor-Critic方法的直接对比。

相关

  • 项目
  • Dispatch
  • Dispatch
  • Dispatch