fangvv/VN-MADDPG

Code for paper "基于多智能体深度强化学习的车联网通信资源分配优化"

何を解決するか

このプロジェクトは、接続された車両のインターネット(IoCV)におけるスペクトル共有とリソース割り当ての問題に対処します。特に、車両間通信(V2V)リンクの送信電力とリソースブロック(RB)選択を最適化し、伝送速度と全体的な容量を向上させることを目的としています。これにより、車両間インフラ通信(V2I)リンクの性能を損なうことなく、高速移動する都市環境における急激なチャネル変化に対応します。中央集権的な管理が現実的でない状況でも、効果的なリソース管理を実現します。

仕組み

このプロジェクトは、中央集権的学習と分散実行(CTDE)フレームワークに基づく、マルチエージェント深層決定論的方策勾配(MADDPG)アルゴリズムを実装しています。

  • エージェント: 各V2Vリンクがエージェントとして扱われます。
  • 観測: エージェントは、リソースブロックにおける高速・大規模フェージング、干渉レベル、ペイロード状態などの局所状態を観測します。
  • 行動: エージェントは連続値を出力し、リソースブロックを選択し、送信電力レベルを決定します。
  • 報酬: 全体的なV2Iリンク容量とV2V伝送成功確率に基づいて共有報酬が計算されます。
  • 学習: 学習中は、すべてのエージェントの行動を集約する中央集権的クライティックネットワークを使用して学習を安定化します。実行時には、分散型アクターネットワークのみを使用するため、車両は局所観測に基づいて意思決定を行うことができます。

対象ユーザー

車両ネットワーク、無線通信リソース割り当て、マルチエージェント強化学習(MARL)によるネットワーク最適化に取り組む研究者およびエンジニア。

特徴

  • CTDEフレームワーク: マルチエージェント環境の非定常性に対処するための中央集権的学習を採用しつつ、分散実行を維持します。
  • 包括的なベースライン: MADQN(離散行動空間)、単一エージェントDDPG(独立学習)、ランダムポリシーを含む、性能比較用の実装が提供されています。
  • 現実的なシミュレーション: 3GPP TR 36.885都市グリッドモデル(マンハッタンレイアウト)に基づき、LOS/NLOSパスロスとシャドウフェージングをシミュレートしています。
  • 高度なリプレイ: 節点木を用いた均一および優先経験リプレイ(PER)を実装し、効率的なサンプリングを実現しています。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト