目录
手把手教你学 Simulink
—— 基于深度强化学习(PPO)的电机高能效控制策略仿真(工程修正版·落地版)
一、先修正:前版五个误区
误区 1:奖励只用 eta,策略懒惰 ❌
误区 2:动作空间直接输出 id* 绝对值 ❌
误区 3:观测不含能效关键状态 ❌
误区 4:训练环境太粗糙 ❌
误区 5:能耗指标只看折算 1 小时 ❌
二、总体架构(三层,Simulink)
三、Step ① 电机效率模型(显式,奖励计算基础)
3.1 参数(1.5kW 伺服,与系列一致)
3.2 损耗分解函数
四、Step ② ★自定义训练环境(MATLAB custom env)
4.1 环境类
4.2 关键:动作/观测规范化(PPO 收敛命门 [12])
五、Step ③ ★PPO 网络与训练
5.1 Actor-Critic(含规范化层 [12])
5.2 两阶段训练(修正前版单环境 [2])
六、Step ④ Simulink 推理子系统(落地)
七、Step ⑤ 测试工况(NEDC 类循环)
八、典型结果(预期量级)
8.1 循环能耗(30s NEDC 片段,标准化)
8.2 分段效率(PPO 学到了什么)
8.3 损耗分布变化
8.4 训练收敛曲线(对齐 [2][12])
8.5 与前面系列的组合效应
九、调参边界与避坑(PPO 特有,本讲重点修正)
十、与前面系列的关系
十一、下一步 3 选 1