news 2026/8/9 21:31:46

用MATLAB实现安全强化学习(Safe RL)

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
用MATLAB实现安全强化学习(Safe RL)

MATLAB代码:安全 强化学习 关键词:safe RL 仿真平台:MATLAB 主要内容:此代码展示了如何使用 Constraint Enforcement 块来训练强化学习 (RL) 代理。 此块计算最接近受约束和动作边界的代理输出的动作的修改控制动作。 训练强化学习代理需要 Reinforcement Learning Toolbox 。 在此示例中,代理的目标是使绿球尽可能靠近红球不断变化的目标位置。 具体步骤为创建用于收集数据的环境和代理,学习约束函数,使用约束强制训练代理,在没有约束执行的情况下训练代理。

在这篇博文中,咱们来聊聊如何用MATLAB实现安全强化学习(Safe RL)。安全强化学习在如今的很多领域都非常重要,它能确保在学习过程中系统始终保持在安全范围内。

主要代码展示及分析

咱们先来看核心代码,这段代码展示了如何使用Constraint Enforcement块来训练强化学习 (RL) 代理。

% 假设这里已经加载了Reinforcement Learning Toolbox % 创建用于收集数据的环境和代理 env = rlPredefinedEnv('CartPole-Discrete'); agent = rlQAgent(env.ObservationInfo, env.ActionInfo);

在这段代码里,我们首先利用rlPredefinedEnv创建了一个预定义的环境,这里用的是'CartPole-Discrete'环境,就好比是搭建了一个舞台。然后通过rlQAgent创建了一个Q学习代理,这个代理就像是舞台上要表演的演员,它会根据环境的反馈来学习怎么做是最好的。

% 学习约束函数 constraintFunction = @(state,action) state(2) <= 0.5;

这个constraintFunction就是我们的约束函数啦。在这里它表示当状态的第二个元素小于等于0.5时,才满足约束条件。这就像是给演员(代理)设定了一些规则,不能随便乱来。

% 使用约束强制训练代理 trainOpts = rlTrainingOptions(... 'MaxEpisodes',500,... 'MaxStepsPerEpisode',100,... 'ScoreAveragingWindowLength',10); trainResults = train(agent, env, trainOpts,... 'ConstraintFunction', constraintFunction);

在这部分,我们定义了训练选项trainOpts,设定了最大episode数为500,每个episode最大步数为100,分数平均窗口长度为10。然后调用train函数来训练代理,并且传入了我们之前定义的约束函数constraintFunction。这就好比告诉演员(代理),按照这些规则和训练方式去学习,不断提升自己的“演技”。

% 在没有约束执行的情况下训练代理 trainResultsWithoutConstraint = train(agent, env, trainOpts);

最后这部分代码,我们又在没有约束的情况下训练了代理,这样可以对比有约束和无约束时代理的学习效果。就好比看看演员(代理)没了规则的束缚,会有怎样不同的表现。

应用场景说明

在此示例中,代理的目标是使绿球尽可能靠近红球不断变化的目标位置。通过这些步骤,我们就能很好地控制代理的行为,在满足安全约束(这里的约束函数)的前提下,让绿球完成靠近红球的任务。

MATLAB代码:安全 强化学习 关键词:safe RL 仿真平台:MATLAB 主要内容:此代码展示了如何使用 Constraint Enforcement 块来训练强化学习 (RL) 代理。 此块计算最接近受约束和动作边界的代理输出的动作的修改控制动作。 训练强化学习代理需要 Reinforcement Learning Toolbox 。 在此示例中,代理的目标是使绿球尽可能靠近红球不断变化的目标位置。 具体步骤为创建用于收集数据的环境和代理,学习约束函数,使用约束强制训练代理,在没有约束执行的情况下训练代理。

整个过程里,那个Constraint Enforcement块起到了关键作用,它计算最接近受约束和动作边界的代理输出的动作的修改控制动作,就像一个裁判,时刻看着代理的动作,确保不违规。而训练强化学习代理当然是需要Reinforcement Learning Toolbox 啦,这就像是一个必备的工具包,没它可玩不转。

希望通过这篇博文,大家对用MATLAB实现安全强化学习有更清晰的认识。可以自己动手试试,调整调整参数,看看代理的表现会有什么不同哦。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/9 13:42:37

超声波深度测量仪设计与实现

超声波深度测量仪设计与实现 一、设计背景与意义 超声波深度测量在水文监测、工业液位控制、水产养殖、污水处理等领域具有不可替代的作用。传统深度测量方法&#xff08;如浮标法、机械探测法&#xff09;存在操作复杂、测量滞后、易受环境干扰等问题&#xff0c;现有超声波…

作者头像 李华
网站建设 2026/8/9 13:42:37

【Redis持久化核心】AOF/RDB通俗详解+多场景对比

在讲核心内容前&#xff0c;先定一个前提&#xff1a;Redis是纯内存数据库&#xff0c;数据都存在内存里&#xff0c;一旦Redis重启/服务器断电&#xff0c;内存数据会直接消失。持久化就是Redis把内存数据“存到硬盘文件里”的操作&#xff0c;目的是重启后能恢复数据&#xf…

作者头像 李华
网站建设 2026/8/9 13:43:03

贡嘎山下的蓝色冰川,藏着海螺沟的旷世温柔

海螺沟位于四川省甘孜藏族自治州&#xff0c;其核心特点是同一区域内冰川、原始森林、温泉与雪山的罕见共存&#xff0c;形成了强烈而独特的视觉与地理反差。景区发源于贡嘎雪山东坡&#xff0c;主沟纵深超过30公里。现代海洋性冰川是这里的首要地质特征&#xff0c;巨大的冰舌…

作者头像 李华
网站建设 2026/8/9 4:05:46

django+Pythonuniapp的心理咨询信息系统APP小程序

文章目录技术栈与架构设计核心功能模块数据安全与合规性能优化策略部署与扩展性典型代码片段&#xff08;Django示例&#xff09;系统设计与实现的思路主要技术与实现手段源码lw获取/同行可拿货,招校园代理 &#xff1a;文章底部获取博主联系方式&#xff01;技术栈与架构设计 …

作者头像 李华
网站建设 2026/8/9 14:42:38

每天一个Linux命令_tar

tar 是 Tape Archive&#xff08;磁带归档&#xff09;的缩写 tar用来压缩和解压文件。tar本身不具有压缩功能。他是调用压缩功能实现的 打包&#xff08;不压缩&#xff09;&#xff1a;tar -cf 归档名.tar 源文件/目录 tar -cf testdir.tar testdir 解压&#xff08;不压…

作者头像 李华
网站建设 2026/8/8 19:33:22

生成式AI催生GEO优化,如何成为其内容权威信源?

生成式人工智能技术迅猛发展之际&#xff0c;一个叫GEO优化的全新概念于数字内容领域暗暗兴起。这种优化策略可不是传统搜索引擎优化即SEO的简单扩展&#xff0c;而是专门按照生成式AI的内容分发逻辑予以设定的一整套系统性办法。为理解GEO优化&#xff0c;就得从生成式AI的工作…

作者头像 李华