fangvv/UAV-DDPG
Code for paper "Computation Offloading Optimization for UAV-assisted Mobile Edge Computing: A Deep Deterministic Policy Gradient Approach"
解決的問題
本專案實作一種強化學習方法,用於優化UAV輔助的行動邊緣運算(MEC)系統中的計算卸載。旨在透過聯合優化使用者排程、任務卸載比例、UAV的飛行角度與飛行速度,在動態且不可控的環境中,最小化使用者裝置(UE)的最大處理延遲。
工作原理
系統使用深度確定性策略梯度(DDPG)演算法來處理高維狀態空間與連續動作空間。
- 環境模擬:自訂模擬器建模3D區域、通訊頻寬、UAV電池與UE位置。根據傳輸時間與運算時間計算處理延遲,並考慮視線(LOS)與非視線(NLOS)通訊條件。
- DDPG代理:採用Actor-Critic架構。Actor網路決定最佳動作(目標UE、飛行角度、距離與卸載比例),Critic網路評估這些動作的Q值。
- 狀態歸一化:原始狀態資料(如電池電量與座標)被縮放到[0, 1]範圍,以穩定訓練並加速收斂。
- 基線比較:專案包含DQN(使用離散化動作空間)與Actor-Critic的實作,用於性能對比。
適用對象
從事無線通訊、UAV輔助邊緣運算,以及深度強化學習在行動網路資源配置中應用的研究人員與工程師。
特色
- 聯合優化:同時管理飛行軌跡與任務卸載比例。
- 連續動作空間:使用DDPG避免動作離散化所帶來的限制。
- 消融研究:包含特定程式碼版本,用於測試狀態歸一化與探索雜訊的影響。
- 全面基線:提供與DQN及基本Actor-Critic方法的直接比較。
相關
- 專案
- Dispatch
- Dispatch
- Dispatch