fangvv/VN-MADDPG

Code for paper "基于多智能体深度强化学习的车联网通信资源分配优化"

解決的問題

本專案解決了連接車輛的網際網路(IoCV)中的頻譜共享與資源分配問題。具體而言,旨在優化車對車(V2V)鏈路的傳輸功率與資源區塊(RB)選擇,以提升傳輸速率與總容量,同時不損害車對基礎設施(V2I)鏈路的效能,特別適用於高速移動的城市環境,其中快速變化的通道使得集中式管理不切實際。

工作原理

本專案基於集中訓練、分散執行(CTDE)框架,實作多智能體深度決定性策略梯度(MADDPG)演算法。

  • 智能體:每個V2V鏈路皆被視為一個智能體。
  • 觀測:智能體觀測本地狀態,包括資源區塊上的快速與大尺度衰落、干擾水準以及資料負載狀態。
  • 動作:智能體輸出連續值,用於選擇資源區塊並決定傳輸功率水準。
  • 獎勵:根據總V2I鏈路容量與V2V傳輸成功率計算共享獎勵。
  • 訓練:訓練期間,由一個中心化的Critic網路聚合所有智能體的動作以穩定學習過程。執行時僅使用去中心化的Actor網路,使車輛能根據本地觀測做出決策。

適用對象

從事車聯網、無線通訊資源分配,以及多智能體強化學習(MARL)在網路優化中應用的研究人員與工程師。

亮點

  • CTDE框架:採用集中式訓練以應對多智能體環境的非穩態性,同時保持去中心化執行。
  • 全面的基線:包含MADQN(離散動作空間)、單一智能體DDPG(獨立學習)與隨機策略的實作,用於效能對比。
  • 真實模擬:基於3GPP TR 36.885城市網格模型(曼哈頓佈局),模擬LOS/NLOS路徑損耗與陰影衰落。
  • 高階經驗回放:使用段樹實作均勻與優先經驗回放(PER),以實現高效採樣。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案