fangvv/UAV-DDPG

Code for paper "Computation Offloading Optimization for UAV-assisted Mobile Edge Computing: A Deep Deterministic Policy Gradient Approach"

解決的問題

本專案實作一種強化學習方法,用於優化UAV輔助的行動邊緣運算(MEC)系統中的計算卸載。旨在透過聯合優化使用者排程、任務卸載比例、UAV的飛行角度與飛行速度,在動態且不可控的環境中,最小化使用者裝置(UE)的最大處理延遲。

工作原理

系統使用深度確定性策略梯度(DDPG)演算法來處理高維狀態空間與連續動作空間。

  • 環境模擬:自訂模擬器建模3D區域、通訊頻寬、UAV電池與UE位置。根據傳輸時間與運算時間計算處理延遲,並考慮視線(LOS)與非視線(NLOS)通訊條件。
  • DDPG代理:採用Actor-Critic架構。Actor網路決定最佳動作(目標UE、飛行角度、距離與卸載比例),Critic網路評估這些動作的Q值。
  • 狀態歸一化:原始狀態資料(如電池電量與座標)被縮放到[0, 1]範圍,以穩定訓練並加速收斂。
  • 基線比較:專案包含DQN(使用離散化動作空間)與Actor-Critic的實作,用於性能對比。

適用對象

從事無線通訊、UAV輔助邊緣運算,以及深度強化學習在行動網路資源配置中應用的研究人員與工程師。

特色

  • 聯合優化:同時管理飛行軌跡與任務卸載比例。
  • 連續動作空間:使用DDPG避免動作離散化所帶來的限制。
  • 消融研究:包含特定程式碼版本,用於測試狀態歸一化與探索雜訊的影響。
  • 全面基線:提供與DQN及基本Actor-Critic方法的直接比較。

相關

  • 專案
  • Dispatch
  • Dispatch
  • Dispatch