简介:这份资源是面向计算机相关专业学生与从业者的车联网通信资源分配优化项目源码,基于多智能体深度强化学习实现,可作为毕业设计、期末课程设计或课程大作业的完整参考方案。项目围绕车联网场景下的通信资源分配问题,整合了MADDPG、MADQN、DDPG等多种强化学习算法,并配套环境建模、经验回放、随机基线等模块,便于读者理解多智能体协作与资源调度的实现思路。压缩包共20个文件,以13个Python源码为主,另含6个编译缓存文件与1份使用说明文档,整体约72KB,结构紧凑、便于快速定位核心代码。该资源为个人毕设成果,评审分达97分,代码经过严格调试,可稳定运行。目前已有328人学习下载,适合希望深入强化学习与车联网交叉方向、需要可运行工程范例的读者参考借鉴。
1. 车联网资源分配跑不通?先看清这套 MADDPG 源码的真实骨架
车联网通信资源分配优化这个方向,很多人卡在第一步:仿真环境搭不起来,或者多智能体一训练就发散。这套基于多智能体深度强化学习的 Python 源代码,核心是把 V2V(车与车)和 V2I(车与基础设施)链路的功率与频谱分配建模成多智能体博弈问题,再用 MADDPG 及其变体去解。它包含 VN-MADDPG、SAMADDPG、MADDPG、MADQN、DDPG 五套算法实现,外加 Random 基线,环境文件统一叫Environment_marl.py。适合正在做车联网资源分配毕业设计、课程大作业,或者想拿一个能跑通的多智能体 DRL 框架改自己场景的人。下面我按实际拆包顺序,把环境、算法、训练、排错一条线讲透。
2. 环境与算法选型:为什么是 MADDPG 而不是独立 DDPG
2.1 车联网资源分配的马尔可夫建模
这套代码把每个 V2V 链路看作一个智能体,状态包括链路信道增益、干扰功率、剩余队列等,动作是发射功率和频谱选择,奖励与 V2I 链路容量和 V2V 链路可靠性挂钩。Environment_marl.py里定义了step()和reset(),这是所有算法的公共接口。常见做法是:先跑 Random 基线拿到一个下界,再对比 MADDPG 系列,否则你无法判断训练出来的策略到底有没有学到东西。
环境的关键参数集中在文件开头的常量区,比如车辆数量、信道数量、噪声功率、最大发射功率。改场景时优先动这几个,不要一上来就改奖励函数,否则后面排查会变成黑匣子。
2.2 五套算法各自的定位
| 算法 | 文件 | 适用场景 | 特点 |
|---|---|---|---|
| Random | random.py | 基线对照 | 不学习,用于验证环境奖励量级 |
| DDPG | DDPG_method.py | 单智能体对照 | 把多智能体当独立个体,忽略非平稳性 |
| MADDPG | maddpg.py/model_agent_maddpg.py | 主算法 | 集中训练分散执行,评论家看全局状态 |
| MADQN | madqn.py | 离散动作对照 | 动作空间离散时用,和连续动作对比 |
| VN-MADDPG / SAMADDPG | 对应目录 | 改进变体 | 在 MADDPG 基础上做价值分解或注意力机制 |
选型理由很直接:车联网里每个链路的决策会互相影响,独立 DDPG 把其他智能体当环境的一部分,训练时非平稳性会导致策略震荡。MADDPG 的集中评论家能看到所有智能体的状态和动作,缓解了这个问题。如果你只是做课程设计,先把 MADDPG 跑通,再拿 MADQN 做离散动作的对比实验,论文里的对比表格就够用了。
2.3 环境初始化的可复现步骤
拿到包后先确认 Python 版本和依赖。代码基于 PyTorch,常见做法是建一个干净虚拟环境:
python -m venv venv_marl source venv_marl/bin/activate # Windows 用 venv_marl\Scripts\activate pip install torch numpy matplotlib然后进到Environment_marl.py所在目录,先单独跑一次环境自检:
# 环境自检:确认 reset 和 step 返回维度正确 from Environment_marl import Environment env = Environment() state = env.reset() print("state dim:", len(state)) next_state, reward, done, info = env.step([0.5] * env.n_agents) print("reward:", reward, "done:", done)逻辑说明:reset()返回初始状态向量,长度应等于智能体数量乘以每个智能体的状态维度。step()接收一个动作列表,返回下一状态、奖励、终止标志和信息字典。参数说明:动作值一般归一化到 0 到 1 之间,对应发射功率比例;如果传入越界值,环境内部通常会裁剪,但最好自己先确认边界。这一步跑通,说明环境本身没问题,后面算法报错就集中在训练逻辑上。
3. MADDPG 训练主循环:从 replay buffer 到集中评论家
3.1 经验回放与 segment_tree 的作用
replay_buffer.py和replay_memory.py负责存(state, action, reward, next_state, done)五元组。MADDPG 目录下还有segment_tree.py,这是优先经验回放用的数据结构,按 TD 误差采样,让训练更聚焦在难样本上。如果你发现训练前期奖励上升很慢,可以先关掉优先回放,用均匀采样跑一遍对比,确认不是采样逻辑写错。
# 优先经验回放采样核心逻辑(简化示意) import numpy as np class PrioritizedBuffer: def __init__(self, capacity, alpha=0.6): self.capacity = capacity self.alpha = alpha self.buffer = [] self.priorities = np.zeros(capacity, dtype=np.float32) self.pos = 0 def add(self, transition, td_error): max_prio = self.priorities.max() if self.buffer else 1.0 if len(self.buffer) < self.capacity: self.buffer.append(transition) else: self.buffer[self.pos] = transition self.priorities[self.pos] = (abs(td_error) + 1e-5) ** self.alpha self.pos = (self.pos + 1) % self.capacity def sample(self, batch_size, beta=0.4): prios = self.priorities[:len(self.buffer)] probs = prios / prios.sum() indices = np.random.choice(len(self.buffer), batch_size, p=probs) samples = [self.buffer[i] for i in indices] weights = (len(self.buffer) * probs[indices]) ** (-beta) weights /= weights.max() return samples, indices, weights逻辑说明:add()时用 TD 误差的绝对值加一个小常数作为优先级,避免零概率。sample()按优先级概率采样,并用重要性采样权重修正偏差。参数说明:alpha控制优先级程度,0 就是均匀采样;beta控制重要性采样修正强度,训练后期应逐渐退火到 1。常见坑是beta一直设 0.4,导致后期更新方差偏大。
3.2 集中评论家的输入拼接
model_agent_maddpg.py里评论家网络接收的是所有智能体的状态和动作拼接向量。实现时要注意:每个智能体的动作维度可能不同,拼接前必须按固定顺序排列,否则训练时输入维度对不上会直接报错。我一般会在初始化时打印一次评论家输入维度,和n_agents * (state_dim + action_dim)对一遍。
# 评论家输入拼接检查 import torch import torch.nn as nn class Critic(nn.Module): def __init__(self, total_state_dim, total_action_dim, hidden=64): super().__init__() self.net = nn.Sequential( nn.Linear(total_state_dim + total_action_dim, hidden), nn.ReLU(), nn.Linear(hidden, hidden), nn.ReLU(), nn.Linear(hidden, 1) ) def forward(self, all_states, all_actions): x = torch.cat([all_states, all_actions], dim=-1) return self.net(x) # 假设 3 个智能体,每个状态 4 维,动作 2 维 n_agents, state_dim, action_dim = 3, 4, 2 critic = Critic(n_agents * state_dim, n_agents * action_dim) dummy_s = torch.randn(1, n_agents * state_dim) dummy_a = torch.randn(1, n_agents * action_dim) print("critic output:", critic(dummy_s, dummy_a).shape)逻辑说明:torch.cat在最后一维拼接状态和动作,输出一个标量 Q 值。参数说明:total_state_dim和total_action_dim必须是所有智能体维度之和,不是单个智能体的维度。如果这里写错,训练时 loss 会异常大或者直接 NaN。
3.3 训练循环与超参数设置
主训练循环一般在maddpg.py里,每步先让每个智能体根据当前策略选动作,加探索噪声,执行后存回放,再从回放采样更新。关键超参数包括学习率、折扣因子、软更新系数、探索噪声衰减。
# 训练主循环骨架 for episode in range(max_episodes): state = env.reset() episode_reward = 0 for step in range(max_steps): actions = [] for agent in agents: action = agent.select_action(state[agent.id], noise_scale) actions.append(action) next_state, reward, done, _ = env.step(actions) buffer.add((state, actions, reward, next_state, done)) if len(buffer) > batch_size: for agent in agents: agent.update(buffer, agents, gamma=0.95, tau=0.01) state = next_state episode_reward += reward if done: break noise_scale = max(0.05, noise_scale * 0.995) print(f"episode {episode}, reward {episode_reward:.2f}, noise {noise_scale:.3f}")逻辑说明:每个 episode 重置环境,逐步选动作、存经验、更新网络。参数说明:gamma是折扣因子,车联网场景常用 0.9 到 0.99;tau是目标网络软更新系数,0.01 比较稳;noise_scale初始 0.3 到 0.5,按 0.995 衰减,最低保留 0.05 保证持续探索。如果奖励曲线一直不涨,先检查噪声是不是衰减太快,智能体过早停止探索。
4. 避坑与排查:训练不收敛时先看这五条
4.1 奖励曲线震荡不上升
现象:episode reward 在某个值附近来回跳,几百轮没有趋势。原因通常是学习率偏大,或者评论家过拟合。解决:把 actor 和 critic 学习率都降到 1e-4 或 5e-5,加梯度裁剪torch.nn.utils.clip_grad_norm_(params, 0.5),再跑 500 轮看趋势。
4.2 评论家 loss 变成 NaN
现象:训练几十步后 loss 打印 nan。原因一般是输入里有 inf 或者奖励量级过大。解决:在step()返回前检查 reward 是否有限,对奖励做缩放,比如除以 100;同时确认状态归一化,不要让某个维度数值到几千。
4.3 多智能体动作维度对不上
现象:报错size mismatch或cat维度不一致。原因:不同智能体的动作空间定义不同,但拼接时按统一维度处理了。解决:在环境里统一每个智能体的动作维度,或者在评论家拼接前对每个动作做 padding,保证总维度固定。
4.4 优先回放导致训练不稳定
现象:开了 segment_tree 后奖励波动比均匀回放还大。原因:优先级更新太激进,或者重要性采样权重没退火。解决:把alpha从 0.6 降到 0.4,beta从 0.4 线性升到 1.0,观察是否改善。如果还不行,先退回均匀回放把主流程跑通。
4.5 环境随机种子没固定
现象:每次跑结果差异很大,无法复现。原因:numpy 和 torch 的随机种子没设。解决:在训练脚本开头加:
import numpy as np import torch import random seed = 42 np.random.seed(seed) torch.manual_seed(seed) random.seed(seed) if torch.cuda.is_available(): torch.cuda.manual_seed_all(seed)逻辑说明:固定种子后,同一份代码在同一环境下结果可复现。参数说明:seed选 42 只是习惯,换成其他整数也行,但论文里要写清楚用的哪个。
5. 进阶技巧:用 Random 基线验证环境,再拿 MADDPG 做对比实验
跑通训练只是第一步,真正让这套源码在毕业设计里站住脚,是学会用它做对照实验。我一般会强制走一遍这个流程:先跑 Random,再跑独立 DDPG,最后跑 MADDPG 和它的变体,把四条曲线画在同一张图里。Random 的奖励应该是一条水平线,如果它波动很大,说明环境本身随机性过强或者奖励设计有问题,这时候调算法是白费力气。
验证环境是否合理,可以看 Random 基线的平均奖励和方差。如果方差比均值还大,常见做法是增加每个 episode 的步数,或者对奖励做滑动平均。下面这个画图脚本可以直接抄:
import matplotlib.pyplot as plt import numpy as np def moving_average(x, window=50): return np.convolve(x, np.ones(window)/window, mode='valid') # 假设 random_rewards, ddpg_rewards, maddpg_rewards 是三个列表 plt.figure(figsize=(10, 5)) plt.plot(moving_average(random_rewards), label='Random') plt.plot(moving_average(ddpg_rewards), label='Independent DDPG') plt.plot(moving_average(maddpg_rewards), label='MADDPG') plt.xlabel('Episode') plt.ylabel('Average Reward') plt.legend() plt.grid(True) plt.savefig('comparison.png', dpi=150) plt.show()逻辑说明:moving_average做滑动平均,窗口 50 可以滤掉高频震荡,让趋势更清楚。参数说明:window太小曲线还是抖,太大又会滞后,50 到 100 之间比较合适。保存图片时dpi=150够论文用。
还有一个容易被忽略的点:MADDPG 的集中评论家只在训练时用,执行时每个智能体只用本地 actor。如果你在测试阶段还把全局状态喂给评论家,那就不是分散执行了,实验结论会站不住。检查方法很简单,看测试代码里有没有调用评论家网络,正常应该只调用 actor。
从那以后我每次拿到多智能体 DRL 源码,都强制先跑 Random 基线确认环境奖励量级,再固定种子跑三遍 MADDPG 看方差,最后才动超参数。这套流程帮我省了很多来回折腾的时间。希望帮到你。
本文还有配套的精品资源,点击获取