fangvv/VN-MADDPG
Code for paper "基于多智能体深度强化学习的车联网通信资源分配优化"
解决的问题
本项目解决了车联网(IoCV)中的频谱共享与资源分配问题。具体而言,旨在优化车对车(V2V)链路的发射功率和资源块(RB)选择,以提升传输速率和总容量,同时不损害车对基础设施(V2I)链路的性能,尤其适用于高速移动的城市环境,其中快速变化的信道使得集中式管理变得不切实际。
工作原理
本项目基于集中训练、分散执行(CTDE)框架,实现了多智能体深度确定性策略梯度(MADDPG)算法。
- 智能体:每个V2V链路被视为一个智能体。
- 观测:智能体观测本地状态,包括资源块上的快衰落和大尺度衰落、干扰水平以及数据负载状态。
- 动作:智能体输出连续值,用于选择资源块并确定发射功率水平。
- 奖励:基于总V2I链路容量和V2V传输成功率计算共享奖励。
- 训练:训练期间,由一个中心化的Critic网络聚合所有智能体的动作以稳定学习过程。执行时仅使用去中心化的Actor网络,使车辆能够基于本地观测做出决策。
适用对象
从事车联网、无线通信资源分配以及多智能体强化学习(MARL)在网络优化中应用的研究人员和工程师。
亮点
- CTDE框架:采用集中式训练以应对多智能体环境的非平稳性,同时保持去中心化执行。
- 全面的基线:包含MADQN(离散动作空间)、单智能体DDPG(独立学习)和随机策略的实现,用于性能对比。
- 真实仿真:基于3GPP TR 36.885城市网格模型(曼哈顿布局),模拟LOS/NLOS路径损耗和阴影衰落。
- 高级经验回放:使用段树实现均匀和优先经验回放(PER),以实现高效采样。
相关
- Dispatch
- 项目
- 项目
- 项目