news 2026/8/19 9:23:18

Mamba架构与组相对策略优化:重塑水下多智能体协同追捕

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Mamba架构与组相对策略优化:重塑水下多智能体协同追捕

1. 项目概述:当Mamba架构遇上水下多智能体追捕

最近在强化学习圈子里,Mamba架构的热度居高不下,大家都在讨论它如何用状态空间模型(SSM)的范式,巧妙地解决了Transformer在长序列处理上的计算瓶颈。与此同时,水下机器人集群协同作业,比如仿生鱼群对目标的围捕,一直是个既充满魅力又极具挑战的课题。它要求算法不仅要处理高维、连续的观测空间(如水下视觉、声呐数据),还要在多智能体环境中实现高效、稳定的协同策略。当我把这两个看似不相关的领域——前沿的序列建模架构与经典的多智能体强化学习(MARL)问题——放在一起琢磨时,一个想法逐渐成型:能不能用Mamba来重塑多智能体策略优化的核心,特别是解决水下追捕这种需要长时程依赖和紧密配合的任务?

这就是“M$^{2}$GRPO”项目的由来。这个略显复杂的缩写拆解开来就是:Mamba-basedMulti-AgentGroupRelativePolicyOptimization。简单说,它的核心目标是构建一个基于Mamba架构的多智能体强化学习新框架,专门用于优化仿生水下机器人集群的追捕策略。其中,“Group Relative”是关键,它意味着我们不再让每个智能体只盯着全局目标或自己的局部信息,而是让它们以“小组”为单位,更多地关注组内伙伴的相对状态(如相对位置、速度差),从而催生更自然、更高效的群体协同行为,就像真正的鱼群那样。

如果你正在研究多智能体系统、水下机器人,或者对Mamba如何应用于决策与控制问题感到好奇,那么这篇分享或许能给你带来一些新的思路。我会从我们为什么需要这样一个框架讲起,拆解Mamba如何融入策略网络,详解“组相对”策略优化的设计动机与实现,并分享我们在仿真环境搭建、训练调参过程中踩过的坑和收获的经验。

2. 核心思路拆解:为什么是Mamba与组相对策略?

在深入代码之前,我们必须先想清楚两个根本问题:第一,在多智能体追捕任务中,现有主流方法(如基于Transformer或RNN的AC架构)的短板在哪里?第二,Mamba和“组相对”设计如何针对性地补强?

2.1 水下追捕任务的独特挑战与MARL痛点

仿生水下机器人追捕不是一个简单的游戏。首先,感知信息是长序列且充满噪声的。一个机器人通过前视摄像头或侧扫声呐获取的观测,是一连串随时间变化的图像或点云。传统的RNN在处理这种长序列时容易遗忘早期关键信息(如目标首次出现的方向),而Transformer虽然拥有强大的全局注意力,但其$O(N^2)$的计算复杂度在面对高频采样的传感器数据流时,推理延迟会成为实时控制的致命伤。

其次,合作策略需要精细的时空协调。单纯的“中心化训练,去中心化执行”(CTDE)范式,让每个智能体在训练时都能看到全局状态(Global State),这固然能学到协同策略。但在执行时,智能体只能依据局部观测(Partial Observation)行动。这就存在一个鸿沟:训练时依赖的全局信息,在执行时并不可得。更糟糕的是,在动态的水下环境中,全局状态往往维度极高(所有机器人的状态拼接),直接将其作为策略网络的输入,不仅计算负担重,还容易让智能体学到依赖“上帝视角”的脆弱策略,一旦某个队友的信息缺失(如通信中断),整个策略就可能崩溃。

最后,仿生运动本身是连续且高维的。控制一条仿生机器鱼的各个关节,输出的是连续的扭矩信号,策略网络需要输出精确的动作值。这要求策略网络具备强大的特征提取和序列建模能力。

2.2 Mamba:为序列决策而生的新引擎

Mamba架构的提出,正是为了解决序列建模中效率与性能的权衡问题。其核心是选择性状态空间模型(Selective SSM)。与Transformer的注意力机制不同,SSM通过一个隐状态来递归地汇总历史信息,理论上能以线性复杂度处理无限长序列。Mamba的创新在于“选择性”——它让SSM的参数(如离散化步长)依赖于输入,这意味着模型可以动态地决定记住什么、忽略什么。

将其映射到我们的追捕任务上,优势是显而易见的:

  1. 线性复杂度,实时性保障:处理机器人自身的观测历史序列时,计算量随序列长度线性增长,为高频控制(如100Hz)提供了可能。
  2. 长程依赖建模:SSM的隐状态理论上可以携带非常长期的记忆,这对于追踪时隐时现的水下目标至关重要。
  3. 输入依赖的选择性:机器人可以学会“专注”。例如,当声呐突然出现一个强回声(可能是目标),模型可以自动分配更多“注意力”到这一时刻的观测上,而忽略水流造成的持续背景噪声。

因此,我们很自然地想到,用Mamba块来构建每个智能体的策略网络(Actor)和评价网络(Critic)的序列编码器,替代传统的LSTM或Transformer Encoder。

2.3 组相对策略优化:从“全局依赖”到“局部协同”

CTDE框架下的经典算法,如MADDPG或MAPPO,其Critic网络在训练时会使用全局状态$s_t$。这带来了之前提到的执行时依赖缺失的问题。一个直观的改进是,让Critic也只使用局部可获取的信息。但这样又可能学不到有效的协同。

GRPO的灵感来源于动物群体的集体行为。在鸟群或鱼群中,个体并非知晓整个群体的精确全局信息,而是通过感知邻近个体的相对位置和运动(即相对状态)来调整自身行为。我们将这一思想形式化:

  1. 智能体分组:根据任务需要,将N个追捕者动态或静态地划分为K个小组。分组依据可以是空间距离(如k-means聚类)、任务角色(先锋、侧翼、包围)或预先定义。
  2. 定义组相对状态:对于组内的每个智能体i,我们不再使用全局状态$s_t$,而是构建一个组相对状态$\tilde{s}_t^i$。这个状态通常包含:
    • 智能体i自身的绝对状态(位置、姿态、速度)。
    • 目标相对于智能体i的状态(相对位置、相对速度)。
    • 组内所有其他成员相对于智能体i的状态(相对位置、相对速度的集合)。这是最关键的部分。
    • (可选)环境中重要地标相对于智能体i的状态。
  3. 组相对Critic:每个智能体配备一个Critic网络 $Q^i(\tilde{s}_t^i, a_t^i, \tilde{a}_t^{-i})$。它的输入不再是全局动作$a_t$,而是自身动作$a_t^i$和组内其他成员动作的某种聚合表示$\tilde{a}_t^{-i}$(例如,求和、均值或通过一个轻量级网络编码)。这样,Critic在训练时评估的是“在组内伙伴采取这些动作的情况下,我这么做的好坏”。
  4. 组相对策略梯度:策略的更新梯度基于组相对Critic来计算。智能体i的策略$\pi^i$的目标是最大化其组相对Q值。由于组内信息在执行时是可获得的(通过局部通信或感知),因此训练出的策略天然具备去中心化执行的能力。

这种设计带来了多重好处:降低了输入维度,减轻了计算负担;增强了策略的鲁棒性,对组外成员的故障不敏感;促进了涌现更自然的协同行为,如分工、包围、接力追踪等。

M$^{2}$GRPO就是将上述两者结合:用Mamba块处理每个智能体的观测序列,提取强大的时序特征;用组相对策略优化框架,在小组层面实现高效、鲁棒的协同策略学习。

3. 系统架构与Mamba模块集成详解

纸上谈兵终觉浅,我们来具体看看M$^{2}$GRPO的系统是如何搭建的。整个框架遵循CTDE范式,但在网络结构上做了大刀阔斧的改造。

3.1 整体框架与数据流

整个训练系统包含以下几个核心部分:

  • N个智能体(仿生水下机器人):每个智能体有独立的策略网络(Actor)。
  • 一个经验回放池(Replay Buffer):存储全局经验轨迹 $(s_t, a_t, r_t, s_{t+1})$。注意,这里存储的$s_t$是真正的全局状态,用于组相对状态的构建。
  • N个组相对Critic网络:每个智能体对应一个,用于评估其组相对状态-动作对的价值。
  • 一个分组管理器(Grouping Manager):根据当前全局状态,动态计算或更新智能体的分组情况。

在每一步训练中:

  1. 环境返回全局状态$s_t$。
  2. 分组管理器根据$s_t$计算当前分组$\mathcal{G}$。
  3. 对于每个智能体i,根据其所属分组$\mathcal{G}_k$,从$s_t$中提取其组相对状态$\tilde{s}_t^i$。
  4. 每个智能体的Actor网络接收自身的历史观测序列$o_{t-H:t}^i$(通过Mamba编码器),输出动作$a_t^i$。
  5. 所有动作组成联合动作$a_t$,执行后环境返回奖励$r_t$和下一状态$s_{t+1}$。
  6. 将经验$(s_t, a_t, r_t, s_{t+1})$存入回放池。
  7. 从回放池采样一批经验,为每个智能体构建相应的组相对状态$\tilde{s}t^i$, $\tilde{s}{t+1}^i$和组相对联合动作表示,用以更新Critic和Actor网络。

3.2 Mamba策略网络(Actor)设计

这是项目的核心创新点之一。每个智能体的策略网络不再是一个简单的MLP,而是一个序列到动作的编码器

输入: 智能体i最近H步的局部观测序列 [o_{t-H}, ..., o_{t-1}, o_t], 形状为 (H, D_obs) 步骤1: 观测嵌入 使用一个线性层或小型MLP将每步观测o_t映射到更高维的嵌入空间,得到序列 E = [e_{t-H}, ..., e_t], 形状 (H, D_model)。 步骤2: Mamba序列编码 将嵌入序列E送入一个Mamba块(Mamba Block)。Mamba块内部主要包含: a) 选择性SSM层:这是核心。它按时间步递归处理序列,输出一个与输入同长的隐状态序列 H_mamba。 b) 残差连接与层归一化:标准配置,用于稳定训练。 输出是一个富含时序信息的特征序列,形状仍为 (H, D_model)。 步骤3: 时序特征聚合 我们只关心当前时刻基于历史信息做出的决策。因此,我们取出Mamba块输出的最后一个时间步的特征向量 h_t^mamba(或者对所有时间步特征做均值/最大池化)。这个向量编码了智能体过去H步观测的精华信息。 步骤4: 动作生成 将聚合后的特征向量h_t^mamba输入到一个动作头(Action Head)。动作头通常是一个MLP,输出层维度等于动作空间维度。 对于连续动作空间,输出通常是动作的均值μ(通过tanh缩放至[-1,1])和标准差σ(通过softplus确保为正)。最终动作通过重参数化技巧采样得到:a_t = μ + σ * ε, ε ~ N(0, I)。

关键实现细节与调参心得

  • 序列长度H的选择:这需要权衡。H太短,模型缺乏历史上下文;H太长,增加计算量且可能引入过多噪声。在水下追捕中,目标运动有一定规律性。我们通过实验发现,H取相当于目标可能完成一次机动(如转向)的时间步数效果较好。例如,控制频率为10Hz,目标平均5秒变向一次,则H=50。可以从20开始逐步增加,观察性能平台期。
  • Mamba块配置:我们直接使用了开源Mamba架构(如state-spaces/mamba)中的Mamba块。关键参数是d_model(模型维度)和d_state(SSM状态维度)。d_model通常与观测嵌入维度一致,可以从128开始。d_state一般小于d_model,我们发现在16-64之间调整对性能影响显著,它控制了SSM内部记忆容量。一个经验是,任务越需要精细的时序分辨(如区分目标的不同运动模式),d_state应该设得越大。
  • 观测嵌入网络:如果原始观测是图像,则需要CNN编码器;如果是矢量状态(位置、速度等),一个简单的2层MLP足矣。务必在嵌入网络后加入LayerNorm,这对稳定Mamba的训练至关重要。

注意:Mamba块在训练时支持并行扫描(Parallel Scan),效率很高。但在部署推理时,它本质上是递归的,每一步计算只依赖当前输入和上一个隐状态,因此具有恒定(O(1))的内存消耗和每步计算量,非常适合资源受限的水下机器人嵌入式系统。

3.3 组相对Critic网络设计

Critic网络用于评估状态-动作对的价值。在GRPO中,Critic是“组相对”的。

输入对于智能体i: - 组相对状态 $\tilde{s}_t^i$: 一个矢量,包含自状态、目标相对状态、组内伙伴相对状态集合等。 - 自身动作 $a_t^i$: 来自Actor网络的输出。 - 组内联合动作表示 $\tilde{a}_t^{-i}$: 组内其他伙伴动作的聚合。我们采用一个简单的“关系编码器”: 1. 将每个伙伴j的相对状态 $\Delta s_t^{ij}$ 与其动作 $a_t^j$ 拼接。 2. 通过一个共享的MLP(关系网络)处理每个拼接后的向量,得到每个伙伴的贡献向量。 3. 对所有贡献向量求和或求平均,得到 $\tilde{a}_t^{-i}$。 步骤1: 特征融合 将 $\tilde{s}_t^i$, $a_t^i$, $\tilde{a}_t^{-i}$ 拼接成一个大的特征向量。 步骤2: Q值估计 将该特征向量输入一个MLP(通常比Actor的动作头更深更宽),输出一个标量,即Q值 $Q^i(\tilde{s}_t^i, a_t^i, \tilde{a}_t^{-i})$。

为什么用关系编码器而不是简单拼接?如果直接将所有伙伴的动作拼接,输入维度会随小组大小线性增长且顺序敏感。关系编码器通过一个共享网络处理每一对“关系”,然后聚合,实现了排列不变性(组内伙伴顺序不影响结果),并且更贴合“相对”的思想——智能体更关心伙伴“相对于我做了什么”,而不是伙伴动作的绝对值。

3.4 分组策略:静态与动态

分组是GRPO的另一个自由度。

  • 静态分组:训练前固定好分组,适用于角色明确的场景(如固定的编队)。实现简单,但不能适应动态环境。
  • 动态分组:每个时间步根据智能体状态重新分组。常用方法是基于距离的聚类(如K-means, DBSCAN)。我们采用了一种软分组(Soft Grouping)策略:计算一个智能体属于某个组的“概率”,Critic的组相对状态输入是加权平均的。这通过一个可学习的“注意力”机制实现,让智能体学会关注哪些伙伴更相关。动态分组能更好地应对目标逃逸、队友故障等突发情况,但增加了计算复杂度。

在我们的水下追捕实现中,初期使用基于欧氏距离的K-means动态分组,效果稳定。小组数量K是一个超参数,通常设置为追捕者数量N的1/3到1/2,以确保组内有足够的交互。

4. 训练流程、损失函数与超参调优

有了网络结构,接下来就是如何训练它们。我们采用深度确定性策略梯度(DDPG)风格的算法进行更新,因为我们的动作空间是连续的。

4.1 训练算法步骤

对于每个智能体i:

  1. Critic更新:最小化时序差分(TD)误差。 [ L(\theta^{Q^i}) = \mathbb{E}_{(\tilde{s}, a^i, \tilde{a}^{-i}, r, \tilde{s}') \sim \mathcal{D}} \left[ ( Q^i(\tilde{s}, a^i, \tilde{a}^{-i}) - y )^2 \right] ] 其中,目标值$y = r + \gamma \bar{Q}^i(\tilde{s}', \bar{\pi}^i(\tilde{s}'), \bar{\tilde{a}}'^{-i})$。这里$\bar{Q}^i$和$\bar{\pi}^i$是目标Critic和目标Actor网络,用于稳定训练,其参数通过软更新($\tau$通常取0.005)从在线网络复制。 $\tilde{a}'^{-i}$是根据目标Actor网络为组内其他智能体生成的动作计算得到的。
  2. Actor更新:通过策略梯度最大化期望回报。 [ \nabla_{\theta^{\pi^i}} J \approx \mathbb{E}{\tilde{s} \sim \mathcal{D}} \left[ \nabla{a^i} Q^i(\tilde{s}, a^i, \tilde{a}^{-i}) \big|{a^i=\pi^i(\tilde{s})} \cdot \nabla{\theta^{\pi^i}} \pi^i(\tilde{s}) \right] ] 即,沿着Critic对自身动作的梯度方向更新策略,使得动作能获得更高的Q值。
  3. 目标网络更新: [ \bar{\theta}^{Q^i} \leftarrow \tau \theta^{Q^i} + (1-\tau)\bar{\theta}^{Q^i} ] [ \bar{\theta}^{\pi^i} \leftarrow \tau \theta^{\pi^i} + (1-\tau)\bar{\theta}^{\pi^i} ]

4.2 关键超参数与调优实录

多智能体强化学习的训练 notoriously tricky(出了名地棘手),超参数设置至关重要。以下是我们经过大量实验得出的经验:

  • 学习率(LR):Actor和Critic通常设置不同的学习率。Critic需要更快地收敛以提供准确的梯度,因此LR可以稍大(如1e-3),Actor的LR要小一个数量级(如3e-4),防止策略更新过快导致发散。使用AdamW优化器比Adam通常更稳定,因为它的权重衰减处理得更好。
  • 折扣因子 $\gamma$:水下追捕任务中,即时奖励(如靠近目标)很重要,但完成合围的延迟奖励也关键。$\gamma$设得太低(如0.9),智能体会变得短视,可能只顾自己接近目标而破坏队形;设得太高(如0.99),学习速度会变慢。我们发现在0.95到0.98之间是一个甜点区。
  • 回放池大小与批次大小:由于是序列输入,我们存储的是长度为H的观测片段。回放池需要足够大(通常>1e6条经验)以覆盖多样化的状态。批次大小(Batch Size)不宜过小,否则Mamba块的训练不稳定;也不宜过大,以免计算内存爆炸。从256开始,根据GPU内存调整到512或1024是常见做法。
  • 探索策略:在训练初期,Actor输出的动作需要加上探索噪声。我们使用Ornstein-Uhlenbeck (OU) 噪声,因为它具有惯性,更适合连续控制的水下动力学。噪声的大小($\theta$, $\sigma$)需要谨慎设置:初期大一些鼓励探索,随着训练进行可以线性衰减。
  • Mamba特定参数d_state如前所述。另一个是SSM的dt_rank,它控制着离散化步长参数的秩。通常设置为d_model的1/16或1/8即可,无需过多调整。

一个重要的技巧:课程学习(Curriculum Learning)直接让智能体学习追捕移动目标非常困难。我们设计了一个课程:

  1. 阶段一:静态目标。目标静止,奖励函数简单(负的距目标距离)。让智能体先学会最基本的趋近行为,并初步感受组内协作(避免碰撞)。
  2. 阶段二:匀速直线运动目标。目标以固定速度沿直线运动。智能体需要学会预测和拦截。
  3. 阶段三:随机机动目标。目标进行随机转弯、加速。这是最终考验。 在每个阶段,只有智能体的平均成功率(如距离目标一定范围内)达到阈值(如80%),才进入下一阶段。这大大加快了训练收敛速度。

5. 仿真环境构建与实战问题排查

理论最终要落地到代码和实验中。我们基于PyTorchOpenAI Gym接口规范搭建了自定义的水下追捕仿真环境,并利用Isaac Gym的高性能物理仿真能力进行大规模并行训练。

5.1 仿真环境核心要素

  1. 智能体动力学模型:我们采用了简化版的仿生机器鱼动力学模型。每条鱼有3个自由度(平面位置x, y和偏航角ψ),通过尾部关节的周期性摆动产生推进力。动作空间是摆动频率和幅值。这是一个欠驱动系统,控制难度较大。
  2. 目标与障碍物:目标可以是另一个智能体(逃跑者),也可以是预设轨迹的点。环境中会随机放置圆柱体作为障碍物,增加任务的复杂性。
  3. 观测空间
    • 局部观测:智能体自身的速度、角速度、关节状态;目标在自身坐标系下的相对位置和速度;最近几个障碍物的相对位置;以及组内其他智能体在自身坐标系下的相对位置和速度(这是实现GRPO的关键输入)。
    • 全局状态(仅训练时可用):所有智能体和目标的绝对位置、速度、姿态。用于构建组相对状态和计算全局奖励。
  4. 奖励函数设计:这是引导智能体行为的关键。一个多目标的奖励函数如下: [ r_t^i = w_1 \cdot \text{DistReward} + w_2 \cdot \text{GroupReward} + w_3 \cdot \text{CollisionPenalty} + w_4 \cdot \text{ActionPenalty} ]
    • DistReward: 基于智能体i与目标距离的奖励,例如 $-\alpha \cdot d_{it}$。
    • GroupReward:组协同奖励。鼓励组内智能体保持队形(如特定包围圈),例如负的组内智能体间距离的方差。
    • CollisionPenalty: 与障碍物、队友或边界碰撞的大幅负奖励。
    • ActionPenalty: 小幅负奖励,鼓励平滑控制,防止动作抖动。

5.2 实战中遇到的典型问题与解决方案

在长达数月的调试中,我们遇到了无数坑。这里列出最具代表性的几个:

问题1:训练初期,所有智能体“躺平”,奖励不增长。

  • 现象:探索噪声下,智能体动作随机,奖励始终在最低值徘徊,Q值也学不到东西。
  • 排查:首先检查奖励函数。是不是碰撞惩罚太大,导致任何动作都得到极负奖励?我们将碰撞惩罚调小,并增加了“存活奖励”(每步一个小正奖励),鼓励智能体先“活下来”。其次,检查Critic的初始化。如果Q值初始估计过高或过低,会影响策略梯度。我们使用了正交初始化(Orthogonal Initialization)来稳定网络初始输出。
  • 解决:采用课程学习,从最简单的任务开始。同时,在训练的最初几千步,使用一个较大的探索噪声,并设置一个探索奖励,鼓励智能体覆盖更多状态空间。

问题2:训练不稳定,策略性能突然崩溃(Catastrophic Forgetting)。

  • 现象:训练曲线本来稳步上升,突然断崖式下跌,之后很难恢复。
  • 排查:这是离策略(Off-policy)算法和函数近似的经典问题。首先怀疑回放池。如果池中旧经验(对应旧策略)太多,而新策略产生的经验质量不高,会导致Critic在旧数据上过拟合,对新策略评估不准。我们检查了经验采样是否均匀。
  • 解决:采用了优先级经验回放(PER),让TD误差大的经验(通常是策略改变后产生的新经验或关键转折点经验)有更高概率被采样。同时,大幅降低了Actor的学习率,让策略更新更平缓。此外,定期保存策略快照,一旦崩溃可以回滚。

问题3:组内智能体行为同质化,没有分工。

  • 现象:所有追捕者都采取几乎相同的策略,一窝蜂地冲向目标,无法形成有效的包围。
  • 排查:这是MARL中的“惰性智能体”问题。由于共享奖励和相似的网络结构,智能体容易学到相同的策略。我们检查了组相对Critic的输入,确保每个智能体接收的组相对状态是以自身为参考系的,这本身就引入了差异性。但还不够。
  • 解决:我们在奖励函数中引入了差异化奖励。例如,给距离目标最近的智能体额外奖励(鼓励先锋),给位于目标侧翼的智能体额外奖励(鼓励包围)。更高级的做法是使用角色信息,在智能体的观测中加入一个可学习的角色编码(Role Embedding),让策略网络根据角色输出不同动作。

问题4:Mamba训练时出现NaN损失。

  • 现象:训练几个epoch后,损失值突然变成NaN。
  • 排查:这是数值不稳定问题。Mamba块中的SSM涉及矩阵指数运算,在极端参数下可能产生数值溢出。首先检查输入数据是否做了归一化(Normalization)。观测值的范围差异巨大(位置可能是几十,角度是π),必须归一化到[-1,1]或[0,1]区间。
  • 解决:除了数据归一化,我们在Mamba块后和每个线性层前都加入了LayerNorm。同时,使用梯度裁剪(Gradient Clipping),防止梯度爆炸。将优化器从Adam切换到AdamW,并设置较小的权重衰减(如0.01),也有效提升了稳定性。

问题5:仿真到实物的迁移(Sim-to-Real)差距。

  • 现象:在仿真中表现完美的策略,部署到真实水下机器人上效果大打折扣。
  • 排查:动力学模型不精确、传感器噪声、通信延迟是主要原因。
  • 解决:我们在仿真中加入了大量的域随机化(Domain Randomization):随机化机器人的质量、浮力、水阻系数;在观测中添加高斯噪声和丢包;随机化水流速度和方向。这迫使策略学习在更宽泛的环境参数下都鲁棒的行为。此外,我们采用了在线自适应策略,让机器人在执行过程中,用少量真实数据微调策略网络的最后一层。

从零开始构建M$^{2}$GRPO框架是一次充满挑战但也收获巨大的旅程。它不仅仅是把Mamba和MARL拼在一起,更是在理解两者本质后的一种有机融合。Mamba为每个智能体提供了强大的、高效的“记忆”与“专注”能力,而组相对策略优化则从机制上引导智能体学会像自然群体那样,基于局部相对信息进行协同。这套框架不仅在水下追捕任务上取得了比传统MAPPO、QMIX基线更优的性能(更高的捕获率、更低的碰撞率、更节能的路径),其推理效率也使得在算力有限的嵌入式系统上部署成为可能。

当然,它远非完美。动态分组的计算开销、小组间通信的建模、以及更复杂的对抗性环境(如存在干扰目标)都是未来可以深入的方向。但至少,它为我们打开了一扇门,一扇用现代序列建模思想革新多智能体协同决策的门。如果你也对这个方向感兴趣,不妨从复现一个简单的2v1追捕环境开始,亲手感受一下Mamba处理序列决策的魔力,以及智能体们如何从一团乱麻中逐渐学会精妙配合的过程。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/19 9:17:49

选对AI论文平台少掉 3 把头发!高赞工具实测 + 选择避坑

每到毕业季,无数同学都陷入论文的“死循环”:选题毫无头绪、写初稿卡壳、格式反复调整、查重标红一大片、AIGC检测风险高悬,通宵熬夜成了家常便饭。很多人以为AI工具能一键生成整篇论文,结果踩坑后才明白,选错工具不仅…

作者头像 李华
网站建设 2026/8/19 9:16:47

AI-Agent上下文管理:从原理到实战的健壮策略与架构设计

1. 项目概述:AI-Agent的“记忆”管理最近在开发和调试各种AI-Agent时,我几乎每天都会遇到一个老朋友——Context。无论是调用大模型API时冷不丁蹦出的“maximum context length is ... tokens”,还是在构建复杂工作流时遇到的“this context …

作者头像 李华
网站建设 2026/8/19 9:15:23

一场有效的经营分析会:四个必须谈,四个坚决不谈

很多企业每月都开经营分析会,但会议结束后,经营问题依然没有解决。财务汇报收入、利润和费用,销售解释目标没有完成的原因,业务部门轮流展示几十页PPT。两个小时过去,大家知道“哪些数字发生了变化”,却没有…

作者头像 李华
网站建设 2026/8/19 9:15:21

从 0 开始做一个 AI 漫剧平台:技术、踩坑和成长复盘

> 这篇文章是我对「浮光造梦局 Dreamweaver Studio」的一次阶段性总结。它还不是一个完美项目,但它让我真实经历了一次从想法、原型、前后端、AI 接入、视频导出到工程整理的完整过程。一、为什么想做这个项目一开始我只是想做一个比较有意思的 AI 应用&#xff…

作者头像 李华
网站建设 2026/8/19 9:15:07

EmbodiedLGR:轻量级图表示与检索在机器人语义-空间记忆中的应用

1. 项目缘起:当机器人需要“记住”世界时,我们面临什么?让一个机器人记住它去过哪里、见过什么,并且能根据新的指令快速找到相关的位置或物体,听起来像是科幻电影里的标配。但在真实的机器人研发中,这恰恰是…

作者头像 李华