fangvv/UAV-DDPG

Code for paper "Computation Offloading Optimization for UAV-assisted Mobile Edge Computing: A Deep Deterministic Policy Gradient Approach"

何を解決するか

このプロジェクトは、UAV支援型モバイルエッジコンピューティング(MEC)システムにおける計算オフロードを最適化するための強化学習アプローチを実装しています。動的で制御不能な環境において、ユーザー端末(UE)の最大処理遅延を最小化するために、ユーザースケジューリング、タスクオフロード比率、UAVの飛行角度、飛行速度を統合的に最適化します。

仕組み

システムは、高次元の状態空間と連続的な行動空間を扱うために、Deep Deterministic Policy Gradient(DDPG)アルゴリズムを使用しています。

  • 環境シミュレーション: カスタムシミュレータが3D空間、チャネル帯域幅、UAVのバッテリー、UEの位置をモデル化します。伝送時間と計算時間に基づき、視認性(LOS)および視認性なし(NLOS)チャネル状態を考慮して処理遅延を計算します。
  • DDPGエージェント: Actor-Criticアーキテクチャを採用。Actorネットワークは最適な行動(ターゲットUE、飛行角度、距離、オフロード比率)を決定し、Criticネットワークはその行動のQ値を評価します。
  • 状態正規化: バッテリー残量や座標などの生の状態データは[0, 1]範囲にスケーリングされ、学習の安定化と収束の加速を図ります。
  • ベースライン: DQN(離散化された行動空間を使用)とActor-Criticの実装を含み、性能比較が可能になっています。

対象ユーザー

無線通信、UAV支援型エッジコンピューティング、モバイルネットワークにおけるリソース割り当てへの深層強化学習の応用に取り組む研究者およびエンジニア。

特徴

  • 統合最適化: 飛行軌道とタスクオフロード比率を同時に管理。
  • 連続行動空間: DDPGにより、行動の離散化による制約を回避。
  • アブレーションスタディ: 状態正規化と探索ノイズの影響を検証するための特定のコードバージョンを含む。
  • 包括的なベースライン: DQNおよび基本的なActor-Critic手法と直接比較可能な実装を提供。

関連

  • プロジェクト
  • Dispatch
  • Dispatch
  • Dispatch