news 2026/7/29 2:05:52

腾讯机器人X团队打造“会思考也会想象“的机器人大脑——RxBrain

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
腾讯机器人X团队打造“会思考也会想象“的机器人大脑——RxBrain

这项由腾讯机器人X团队、富田实验室与腾讯混元团队联合发布的研究,于2026年7月15日以预印本形式公开,论文编号为arXiv:2607.14187。感兴趣的读者可以通过该编号在arXiv平台查阅完整论文。

**研究概要**

教一个机器人完成任务,远比教一个孩子学骑自行车难得多。孩子看几次示范就能理解"要向前踏、要保持平衡",而机器人往往需要被明确告知每一个步骤,甚至需要提前"想象"自己完成任务之后周围世界会变成什么样子。这种"既能规划步骤、又能在脑海中预见结果"的能力,正是人类与目前大多数机器人之间最本质的差距之一。

腾讯这支联合团队提出了一个名为**Hy-Embodied-RxBrain**(简称RxBrain)的具身认知基础模型,目标是让机器人在制定行动计划时,不仅能用语言描述"第一步做什么、第二步做什么",还能同时在"脑海中"生成每一步执行完成后世界应该是什么样子的画面——就像一个有经验的厨师,不仅知道菜谱上写着"先把洋葱炒软",还能在动手之前就清晰地预见到锅里金黄透明的洋葱应该呈现出什么状态。

这项研究的核心突破在于:它是业界首次将语言推理与视觉想象真正耦合在同一个规划序列中的具身认知模型,而非让两者分别工作后再拼合结果。

---

**一、为什么机器人既要"说"也要"想"?**

现有的机器人智能系统大致分成两个阵营。一类是视觉语言模型,它们擅长理解眼前的画面、听懂人类指令、分解任务步骤,能用语言告诉机器人"先拿起杯子,再把杯子放到托盘上"。这类模型的短板是,它们描述计划时完全停留在语言层面,对于"拿起杯子之后世界应该长什么样"缺乏明确的视觉预见,就像一个从未下过厨房的人照着菜谱念步骤,却没见过食物完成时应有的样子。

另一类是生成式世界模型,它们善于预测动作执行后的画面,能生成"机器手臂伸过去抓住杯子后的视频片段"。但这类模型通常不擅长进行因果推理、理解约束条件或进行长程的逻辑规划,更像是一台擅长渲染画面的摄影机,却没有导演的脚本意识。

RxBrain的思路是:让语言和视觉像乐队里的指挥和乐手一样配合工作。语言负责告诉机器人整首曲子的结构——哪一段先演奏、哪里要停顿、整体节奏是什么;视觉想象则负责把每一段旋律"奏出来",让抽象的乐谱变成实实在在的声音。在RxBrain的规划序列中,语言描述行动步骤、约束条件和决策逻辑,而视觉想象则为每一个步骤生成对应的"世界状态图"——执行完这步之后,眼前的场景应该是什么样子。两者互为补充,缺一不可。

---

**二、RxBrain的"大脑结构"是怎么搭建的?**

RxBrain建立在一种叫做**混合变换器架构**(Mixture-of-Transformers,简称MoT)的技术框架上。普通读者可以把这个架构理解为一座分工明确的大型办公楼:楼里有专门处理文字的部门、专门理解图片的部门、专门生成图片的部门,但这三个部门共享同一套会议室——也就是说,不同部门之间可以充分交流信息,但各自的专业工作又不会相互干扰。

具体来说,RxBrain包含三类主要工作单元。语言变换器负责处理所有文字,包括理解人类指令和生成规划步骤的文字描述;视觉变换器负责理解输入的图像和视频,理解和生成的视觉内容共享同一套"注意力机制"(可以理解为它们看同一套信息,但用不同的方式处理),同时各自有独立的前馈网络(相当于各自的专属处理流水线);此外,还有一个专门负责"视觉生成"的模块,它的处理容量特意做得更大——中间层宽度从6144扩展到12288——因为凭空生成一张有意义的画面比理解一张已有的画面更具挑战性。

整个模型共有62亿个参数,其中语言理解和视觉理解各约15亿,视觉生成模块约24亿,其余分布在共享模块和外围组件中。视觉内容的生成采用了来自FLUX模型的冻结VAE(变分自动编码器)作为图像的编码和解码工具,可以理解为一个专业的图像压缩与还原机器,负责在模型内部表示和最终输出图像之间架桥。

为了让模型在生成规划序列时既能保持因果逻辑(先发生的影响后发生的),又能让同一张图片内部的信息充分交流,RxBrain设计了一套混合注意力机制:处理文字时用因果注意力(只看之前的内容),处理图片时在每张图片内部用双向注意力(图片内所有位置互相参考),跨图片之间仍保持因果顺序。这就像一本故事书:同一页内的插图细节可以互相对照,但后面的页面不能"剧透"前面的内容。

---

**三、RxBrain如何生成"文字+画面"交织的计划?**

RxBrain支持三种输出模式,对应具身任务中的不同需求。

第一种是纯文字生成模式,用于回答关于当前场景的问题或输出语言形式的规划步骤。机器人"看"到眼前的场景后,通过标准的逐词生成方式输出文字答案或行动指令。

第二种是多帧视频预测模式,用于预测执行某个动作后接下来四帧画面会是什么样子。这四帧画面并行生成(而非一帧一帧串行),大幅提升效率,同时帧间保持因果顺序,也就是越后面的帧可以参考越早的帧,但不能"看到未来"。这就像同时制作四格漫画的四个格子,每个格子的画师都能看到前面格子已经画好的内容,但不能偷看后面格子。

第三种是交错生成模式,这也是RxBrain最核心的能力所在。在这种模式下,模型输出的是一个语言与图像交替出现的完整规划序列:先生成第一步的文字描述,再生成对应的目标状态图像;然后把这张生成的图像重新"看"一遍作为上下文输入,再生成第二步的文字,再生成第二步的画面……如此循环,直到任务完成。

关键的设计细节在于:在训练时,模型看到的"上一步生成的图像"不是直接拿来的原图,而是经过了"生成→解码→重新编码"这一完整流程处理过的图像。这么做是为了让训练时和真正推理时的体验尽量一致——因为在实际使用时,上一步的图像确实是模型自己生成的,而不是来自真实世界的照片。这个细节减少了训练和推理之间的"期望差距",让交错生成的质量更加稳定。

---

**四、用五万小时视频训练出"计划感"**

要让RxBrain学会这种语言加视觉的联合规划能力,需要大量带有"每一步动作配对对应状态变化画面"的训练数据。然而,现有的数据集几乎没有这种格式——大多数机器人数据只有动作指令,或只有连续视频,没有把两者精确对齐起来。

为此,研究团队设计了一套全自动的数据构建流水线,把原始具身任务视频转化为"文字+画面"配对的联合规划训练样本。原始视频数据来自四大类来源:真实机器人操作数据(约17292小时)、UMI手持夹持器采集数据(约17506小时)、仿真环境数据(约1317小时)、以及第一人称人类日常操作视频(约14062小时)。总计超过5万小时,包含约2150万个可用片段,通过约2861万个候选片段筛选而来,通过率约75%。

这条流水线分三个阶段。第一阶段是时序片段标注:系统先对视频进行关键帧采样——不是均匀采样,而是优先选取画面变化最明显的时刻,就像一本菜谱只需要在每道工序最关键的时刻拍一张照片,而不是每秒都拍。采样完成后,用一个多模态大语言模型对视频进行整体理解,提出候选动作步骤列表,每个步骤包含一个简短名称、详细描述,以及在关键帧序列中对应的粗略起止位置。随后系统在粗略范围附近密集采样,用模型精确定位每个步骤的真实开始帧和结束帧。

第二阶段是质量验证:对每一个标注出来的片段,系统自动检查它是否符合高质量训练样本的标准。检查项涵盖三大类:语义质量(这个片段是否只包含一个清晰的原子动作?操作目标是否清晰可见?画面是否有水印遮挡?文字描述是否准确匹配画面?动作是否真实发生?两帧锚点是否都可读?)、视觉接地性(手或夹持器是否可见?机器手臂是否可见?目标物体是否有意外消失?)、以及一致性(两帧是否在同一场景?相机视角是否稳定?画面朝向是否正常?描述与视觉变化是否一致?手的变化是否在文字中有所体现?)。如果画面变化有效但文字描述有误,系统会自动修正文字而不是直接丢弃这个片段。最终,约75%的候选片段通过了质量验证。

第三阶段是片段结构化:把通过质量验证的片段组织成四个层级的训练任务。最基础的L0层是单步预测,输入一步的起始画面和动作描述,预测这步结束时的画面;L1层是步骤级联合规划,给定视觉上下文和目标条件,模型输出一系列步骤文字及其对应的结束画面;L2层是子目标规划,把若干步骤合并为更高层次的子目标,每个子目标配有边界画面;L3层是最终状态想象,只给初始画面和任务描述,让模型直接预测整个任务完成时的最终画面。这四个层级从局部到全局,让模型学会在不同粒度上进行联合规划。

---

**五、分两阶段训练:先打基础,再专攻具身**

RxBrain的训练采用两阶段课程式策略,可以类比为先上通识课、再上专业课。

第一阶段是联合视觉语言预训练,训练数据由两大部分混合而成:60%是大规模图文对(来自LAION和COYO数据集,共约2亿条),40%是多模态指令跟随数据(来自LLaVA-OneVision和MAmmoTH,共约1.13亿条)。这一阶段的核心目标是让模型同时学会理解图像和生成图像,在一个共享的表示空间中把语言、视觉感知和视觉生成统一起来,同时保留大语言模型原有的语言能力。图像生成目标损失权重设置相对更高(λ=1.0),语言生成权重相对较低(λ=0.25),这是因为视觉生成能力需要从头建立,而语言能力已有良好基础。

第二阶段是具身监督微调,从第一阶段的检查点继续训练,训练数据混合了六类内容,总计约422份的混合比例:一般图文对(T2I基础数据和高质量图文对,合计约25.9%)、通用多模态理解数据(34.6%)、具身多帧世界模型数据(16.2%)、具身交错规划数据(20.8%)。这一阶段两类损失权重相等(均为1.0),让语言推理和视觉生成在具身任务上协同提升。

训练时使用了最高368块GPU(即46个8卡节点),全局批量大小7360;第二阶段使用312块GPU(39个节点),全局批量3120。两阶段均使用AdamW优化器、余弦学习率调度和bf16精度,图像生成分辨率上限256像素,通过16倍下采样的VAE进行潜变量操作。

---

**六、RxBrain-Bench:专门评测"联合规划"能力的新基准**

为了衡量模型是否真正掌握了"语言+视觉联合规划"的能力,研究团队专门构建了一个新的评测基准:**RxBrain-Bench**。

这个基准分三个评测赛道。第一个赛道叫具身视觉问答(EVQA),评测模型能否从视觉观察中理解具身场景并作出任务相关的决策。题目来自工业、零售和服务等真实商业场景,涵盖高层规划(把任务分解为可执行步骤)、模拟推进规划(在多轮交互中根据中间状态更新后续决策)、细粒度步骤推理(抓取点、运动轨迹、动作选择、时序判断、多视角观察)、错误恢复(识别异常状态并选择正确应对方式)、以及任务完成判断(判断当前状态是否满足目标)。共1123道多选题加258道模拟规划题,总计1381个评测项目。

第二个赛道叫世界状态预测(WorldPred),评测模型在给定当前观察和自然语言动作指令后,能否生成描述动作结果的短时序画面(4帧)。评测标准包含五个维度:观察连续性(生成的第一帧是否自然延续当前观察)、动作正确性(生成的帧序列是否执行了正确的动作)、目标完成度(最终帧是否达到了任务暗示的目标状态)、时序物理合理性(帧间运动是否流畅且物理上合理)、以及与真实轨迹的匹配度,最终加权得分为这五项的线性组合。

第三个赛道叫联合规划(JointPlan),也是RxBrain-Bench最核心的部分,评测模型能否在完全自回归的闭环推演中进行语言加视觉的联合规划。模型在每一步都必须输出自然语言子步骤描述和对应的目标画面,然后以自己生成的画面作为下一步的输入继续规划,直到任务完成。评测标准包含六个维度:观察理解、子任务规划、目标图像正确性、子任务与目标的一致性、完整链条的完成度、以及图像相似度(用DINO特征的余弦相似度衡量生成画面与真实目标画面的接近程度),加权得分覆盖这六个方面。

---

**七、评测结果:在多个维度上表现出色**

在通用图像生成能力方面,RxBrain在GenEval基准上获得82.4分,与专门针对图像生成优化的BAGEL模型(82分)基本持平,明显高于同样具备生成能力的Cosmos-3-Nano模型(71.68分)。这说明RxBrain在扩展到具身任务的同时,并没有牺牲其通用图像生成能力。

在具身与空间理解方面,RxBrain在多个公开基准上处于前列。在CV-Bench上以88.59分排名第一,在EmbSpatial上以82.3分紧追Cosmos-3-Nano(82.1分)的第二位,在DA-2k深度感知理解上以83.4分排名第一。特别在多视角和三维理解领域,RxBrain的优势最为突出:在3DRSBench上以54.1分排名第一,在MMSI-Bench多图空间智能上以35.8分领先,在MindCube空间心理建模上以47.5分名列前茅,在SITE-Bench图像空间理解上以54.9分居首。在机器人轨迹预测上(Share-Robot-Trajectory),RxBrain以51.13分排名第一,比此前最佳模型Cosmos-3-Nano的39.02分高出约12个百分点。在RoboSpatial-Home配置理解上以86.28分排名第一。不过,在需要精确指点定位(Pointing)和机器人抓取位置预测(Share-Robot-Affordance)方面,专门针对空间指向优化的RoboBrain2.5模型仍然更强。

在RxBrain-Bench-EVQA的自建评测中,RxBrain综合得分为72.7分,低于Qwen3.5-4B的78.1分和Cosmos-3-Nano的76.7分,但在成功检测(Success Detection,85.1分)和模拟规划(Simulation Planning,51.6分)两个维度上表现最佳,说明模型在判断任务是否完成以及在多轮模拟中更新决策方面有独特优势。主要差距集中在精细空间定位、轨迹与时序推理以及错误恢复方面。

在世界状态预测(WorldPred)评测中,RxBrain以0.62的综合得分超越Cosmos-3-Nano(0.591)和Wan2.2-TI2V-5B(0.429)。观察连续性得分0.67和动作正确性得分0.65是最强项,时序物理合理性0.53是最弱项,说明生成画面的物理连贯性仍有提升空间。在不同子数据集上的表现从UMI的0.73到arctic的0.35不等,两帧条件输入的整体效果最佳。值得关注的是,RxBrain虽然并非专门的视频生成模型,却超过了专为具身世界建模设计且在大量视频数据上预训练的Cosmos-3-Nano,体现了统一模型架构的优势。

在联合规划(JointPlan)评测中,RxBrain以0.68的综合得分大幅领先所有基线:Cosmos-3-Nano智能体得分0.521,统一多模态模型BAGEL-7B-MoT得分0.503,模块化的Qwen-Agent得分0.431。具体来看,观察理解得分0.83和子任务规划得分0.78是最强项,目标图像正确性0.52是最弱项,再次印证了语言推理能力强于视觉想象能力的规律。在不同规划深度上,两步规划得分0.69,八步规划得分降至0.55,体现了长程推演中误差累积的挑战。RxBrain在子任务规划和链条完成度上的领先优势最大,说明它在保持整体计划一致性方面具有明显优势。

---

**八、从"大脑"到"手臂":扩展到真实机器人动作生成**

RxBrain不只是一个能规划的"大脑",研究团队还把它扩展成能控制机器人手臂实际运动的系统。

扩展的方式是在原有的MoT架构基础上新增一个动作专属分支,包含独立的注意力投影层、前馈网络和层归一化,但仍与语言、视觉和状态的全局注意力共享信息交流。这个动作分支的初始参数复制自视觉理解分支,相当于让它从理解画面的能力出发,重新学习如何把理解转化为动作。

一个特别设计的"门控专家融合"机制让动作分支能够借用视觉生成分支中已经学到的预测性和规划性知识。具体来说,动作模块的前馈网络输出等于动作专属前馈网络的结果加上一个可学习的通道门控权重乘以视觉生成前馈网络的结果。这个门控权重初始为零,意味着训练开始时动作模块完全依靠自身,随着训练推进,门控权重逐渐学习到哪些视觉生成知识对动作预测有帮助,并选择性地引入。这种设计让动作模块不需要从零开始学习规划性知识,而是站在视觉生成模块已有积累的肩膀上。

动作的表示方式是:对于双臂机器人,每个机械手臂的末端执行器状态包含三维位置、四元数姿态和夹持器开合量,共16维。本体感知状态通过轻量级编码器映射为单一状态令牌,未来H步的动作块通过流匹配(Flow Matching)在归一化动作空间中生成,训练目标是让模型预测的速度场在去噪过程中准确指向真实动作方向。

在真实机器人实验中,研究团队选取了三个多阶段家务操作任务进行评测,每个任务各进行100次真机试验。在"摆设餐桌"任务中(需要从架子上取出盘子、叉子和刀并按正确位置摆放),RxBrain成功率97%,超过π0的82%和π0.5的90%。在"折叠收纳眼镜"任务中(需要折叠眼镜腿并放入眼镜盒),RxBrain成功率95%,超过π0的76%和π0.5的82%。在"捡拾垃圾"任务中(需要先开垃圾桶盖再将废纸放入),RxBrain成功率68%,超过π0的46%但略低于π0.5的74%。三个任务的平均成功率为87%,π0为68%,π0.5为82%。需要特别指出的是,这些结果是在没有大规模动作数据预训练的情况下取得的,说明具身规划预训练产生的世界知识确实能够迁移到真实动作控制中。

---

**九、让推理速度跟上机器人的手速**

在实验室里表现优秀的模型,在真正控制机器人时还面临一个重要挑战:速度。如果模型每次预测动作都需要很长时间,机器人就会动得磕磕绊绊,就像一个总是犹豫半天才迈腿的人走路一样。

研究团队对实时部署进行了专项加速优化,并坚守一个底线:所有优化必须在数值上等价于原始模型,也就是说机器人的轨迹不能因为加速而发生任何可测量的变化。

原始模型每帧推理需要210毫秒,主要瓶颈出乎意料地不是矩阵乘法,而是混合变换器架构中的模态分发逻辑:每一层都要重新计算哪些令牌属于语言、哪些属于视觉、哪些属于动作,这个操作在一次前向传播中触发了约1091次nonzero调用,累计占据174毫秒CPU时间,再加上索引操作的48毫秒和拷贝操作的21毫秒。

针对这个瓶颈,研究团队实施了三项优化:预计算前缀键值缓存(观察帧和指令文字的上下文在动作流匹配的多步去噪过程中是固定不变的,可以只计算一次并复用);仅对动作令牌进行快速解码(有了缓存之后,每步去噪只需要处理16个动作令牌,而非989个前缀令牌加16个动作令牌);去同步化模态分发加CUDA图捕获(把每层的令牌路由索引预计算好,用gather和scatter替换布尔索引,消除GPU与CPU之间的反复同步,最后用CUDA图固定整个解码步骤以消除内核启动开销)。三项优化组合后,推理延迟从210毫秒降至143毫秒,提速约1.47倍,同时位置误差小于0.65毫米、姿态误差小于0.73度,完全处于bf16精度的舍入误差范围内。

---

**研究的局限与未来方向**

研究团队坦诚地指出了RxBrain目前存在的三个主要局限。第一,模型规模相对较小(62亿参数),可能限制了它处理高度复杂推理、精细视觉想象和长程规划的能力,扩大模型和数据规模是显然的改进方向。第二,虽然RxBrain能跨多种具身场景泛化,但对于完全陌生的环境、机器人形态或任务领域,仍然需要额外的微调才能达到理想性能。第三,交错生成涉及两种不同的生成范式(文字的自回归生成和图像的流匹配生成),训练和推理之间仍然存在一些差异,尽管通过VAE重建传递的视觉状态构建策略已经有所缓解,但尚未引入强化学习或其他序列级优化方法来进一步对齐两种模态的生成过程。

未来团队计划向两个方向发力:一是扩大模型规模,预期更大的模型将在联合规划的连贯性、世界状态预测的准确性和整体规划能力上带来系统性提升;二是增强自主性,让模型更好地分解开放性任务、监控执行进度、修正规划并以更自主的方式与环境交互。

---

说到底,RxBrain这项工作的意义在于它清晰地回答了一个问题:一个能真正胜任复杂任务的机器人大脑,需要的不仅仅是会说"第一步做什么",也需要能在脑海中"看见"每一步完成后世界应该是什么样子,这两种能力必须紧密耦合,而不是各自为政。RxBrain给出了一套初步但系统的实现方案——从模型架构、数据构建、训练策略到评测体系——为具身认知基础模型的研究开辟了一条有价值的路径。

对这项研究感兴趣的读者可以通过arXiv编号2607.14187找到完整论文,也可以在Hugging Face上查找Tencent/Hy-Embodied-RxBrain-1.0获取模型,在GitHub上查找Tencent-Hunyuan/Hy-Embodied-RxBrain-1.0获取代码。

---

**Q&A**

Q1:RxBrain和普通机器人规划模型有什么区别?

A:普通机器人规划模型要么只用语言描述步骤,要么只生成画面,两者分开工作。RxBrain的特点是把语言步骤规划和视觉状态想象放在同一个序列里同时完成——每说出一个动作步骤,就同时生成那步执行后世界应该是什么样子的画面,两者互相验证、互相依赖。

Q2:RxBrain真实机器人测试的成功率是多少?

A:在三个家务操作任务上,RxBrain平均成功率为87%:摆设餐桌97%,折叠收纳眼镜95%,捡拾垃圾68%。对比基线π0平均68%和π0.5平均82%,RxBrain整体更优,且是在没有大规模动作数据预训练的条件下取得的。

Q3:RxBrain的训练数据有多大规模?

A:研究团队从真实机器人操作、手持夹持器采集、仿真环境和人类第一视角视频四类来源收集了超过5万小时的具身任务视频,通过自动化流水线筛选出约2150万个高质量训练片段,通过率约75%。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/29 2:05:32

001文件怎样解压?分卷压缩包完整解压指南

处理分卷压缩包时,001 文件常常让人困惑。它通常是分卷压缩包的一部分,需要和其他分卷配合才能正常解压。本文将详细介绍 001 文件的本质、常见场景以及正确的解压方法,帮助你高效处理这类文件。 文章目录001文件是什么001为什么常见于分卷压…

作者头像 李华
网站建设 2026/7/29 2:04:24

力扣389题解析:字符串差异检测的三种算法

1. 问题背景与核心需求力扣389题"找不同"是一道经典的字符串处理题目,题目描述如下:给定两个字符串s和t,其中t是由s中的字符随机重排后,再在随机位置添加一个字符得到。要求找出t中被添加的那个字符。这道题看似简单&am…

作者头像 李华
网站建设 2026/7/29 2:04:21

UE5蓝图实战:从零实现AI角色跟随系统,打造智能大鹅伙伴

1. 项目概述:为什么是“一只大鹅”?在UE5的众多炫酷案例里,你可能会看到写实的角色、宏大的场景,但今天我们要聊的,是一个听起来有点“不正经”却极其经典的项目:制作一只会跟随玩家的大鹅。这可不是一个简…

作者头像 李华
网站建设 2026/7/29 2:03:56

NoPhones塑料板走红背后:物理行为干预如何破解数字成瘾

1. 项目概述:一个“塑料板”的意外走红最近在Kickstarter、Indiegogo这类众筹平台上,有个叫“NoPhones”的小玩意儿火了。它看起来简单得离谱——就是一块带硅胶绑带的、手机大小的塑料板,没有任何电子元件,不能发光、不能发声、不…

作者头像 李华
网站建设 2026/7/29 2:03:31

用 npm + Three.js 做一颗西瓜:把夏天的清凉感放进浏览器

一颗西瓜,为什么值得用 3D 来做? 因为它不只是一个红绿配色的图标。切开的果肉、薄薄的白瓤、深浅不一的瓜皮纹、黑色瓜籽和刚从冰箱拿出来的水珠,才是大家对“夏天第一口西瓜”的共同记忆。 这次我用 npm Three.js 做了一个可交互的西瓜小场…

作者头像 李华
网站建设 2026/7/29 2:02:03

云原生技术的2026盘点:K8s、eBPF与WASM的三足鼎立

云原生技术的2026盘点:K8s、eBPF与WASM的三足鼎立一、云原生格局的重新洗牌 Kubernetes 仍是云原生编排的主力工具,但它不再是唯一需要关注的技术。eBPF 被用于网络、观测和安全,WASM 则进入轻量运行时和边缘计算场景。三者负责的层次不同&am…

作者头像 李华