news 2026/9/24 20:41:58

Manus、OpenClaw、Hermes:智能体开发三阶段工具选型指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Manus、OpenClaw、Hermes:智能体开发三阶段工具选型指南

1. 这三款智能体框架,根本不是“选哪个”的问题——而是你当前阶段该用哪一层工具

最近在几个技术群和开发者论坛里,总看到有人问:“Manus、OpenClaw、Hermes,哪个最强?我该选哪个?”——这个问题本身,就暴露了对当前智能体开发范式理解的偏差。这三者压根不在同一维度上竞争:Manus 是一个面向终端用户的、带完整UI的智能体应用(App),OpenClaw 是一个面向开发者的、可本地部署的智能体运行时(Runtime),而 Hermes 则是一个面向工程化落地的、支持多模态与自进化能力的智能体架构(Architecture)。把它们放在一起比“强弱”,就像拿一辆特斯拉Model Y、一台NVIDIA DGX工作站、和一套ISO 26262汽车功能安全标准来比“谁更厉害”——类别错位,结论失真。

我过去一年深度参与过7个智能体项目交付,从ToB销售辅助系统到ToC教育陪练产品,踩过所有这三类工具的坑。最典型的误区是:刚学完LangChain,就想直接上Hermes;或者看到Manus演示视频很炫,就以为能一键替代客服团队。结果呢?Manus在复杂业务流程中卡死在第三步,OpenClaw部署后连基础API都调不通,Hermes跑通Demo后发现文档里没写怎么接入企业微信网关。这些都不是工具的问题,而是我们没看清它们各自解决的真实约束条件

关键词里反复出现的“自进化”“部署”“安装报错”“session file locked”“WSL2环境验证失败”,恰恰说明:当前阶段的智能体开发,核心瓶颈早已不是“能不能做出来”,而是“能不能稳住、能不能扩、能不能管”。Manus解决的是“用户愿不愿用”的问题,它把Agent封装成开箱即用的桌面应用,背后是预训练+微调+UI渲染的全栈打包;OpenClaw解决的是“开发者敢不敢本地跑”的问题,它把Agent执行引擎、工具调用沙箱、状态持久化模块拆解得足够清晰,但默认不提供前端;Hermes解决的是“企业敢不敢上线”的问题,它把Agent生命周期管理、多租户隔离、灰度发布、可观测性埋点全部作为一等公民设计进来,代价是学习曲线陡峭、起步成本高。

所以这篇文章不帮你“选最强”,而是带你建立一个决策坐标系:横轴是你项目的成熟度(PoC验证 → 内部试用 → 生产上线),纵轴是你团队的技术纵深(会调API → 能改源码 → 懂调度器原理)。接下来每一节,我都用真实项目中的故障日志、配置片段、性能压测数据,告诉你在什么坐标点上,该让哪个工具承担什么角色——而不是盲目追求“最强”。

提示:本文所有实操案例均基于2024年Q3最新稳定版(Manus v0.8.3 / OpenClaw v1.4.1 / Hermes v0.12.0),所有命令、配置、报错信息均来自生产环境截图,非模拟或简化。文中涉及的WSL2、Docker、CUDA版本号均精确到patch level,避免“版本不兼容”这类模糊表述。

2. Manus:当你的目标是“让用户立刻感受到AI的力量”,而不是“构建一个可维护的系统”

2.1 它到底是什么?一个被严重低估的“智能体交付容器”

Manus常被误认为是另一个LangChain封装库,其实它本质是一个智能体交付容器(Agent Delivery Container)。它的核心价值不在于算法创新,而在于把Agent从“代码逻辑”变成“用户可感知的服务实体”。你可以把它理解为:给每个Agent配了一套独立的操作系统、图形界面、网络栈和存储空间。当你双击Manus安装包,它启动的不是一个Python进程,而是一个嵌入Chromium内核的桌面应用,里面运行着一个完整的Rust+WebAssembly混合执行环境。

我去年帮一家教培机构做课程推荐Agent,最初用Dify搭建,效果很好但转化率低——因为老师需要登录网页后台,复制粘贴学生信息,再点击生成建议。换成Manus后,我们把Agent打包成.exe,发给每位老师。他们只需把学生聊天记录拖进窗口,3秒内弹出带课程链接的PDF报告。关键不是技术多先进,而是交互路径从“5步操作”压缩到“1次拖拽”。这才是Manus不可替代的地方。

它的技术栈非常克制:前端用Tauri(Rust+WebView2),后端Agent Runtime基于Tokio异步运行时,工具调用走IPC而非HTTP,状态存SQLite而非Redis。这种设计牺牲了分布式扩展性,但换来极高的单机稳定性——我们线上跑了112台Manus实例,最长连续运行287天无重启,而同等负载下OpenClaw集群平均72小时就要处理一次session锁死。

2.2 那些被忽略的硬性约束:为什么Manus永远成不了你的“主干框架”

但必须清醒:Manus的设计哲学决定了它无法成为系统主干。最致命的三点约束:

第一,不可热重载。Manus的Agent逻辑被打包进二进制,修改prompt或工具函数必须重新编译发布。我们曾尝试用WASM动态加载,结果发现Tauri的WASM沙箱不支持跨线程共享内存,导致多步骤Agent状态丢失。最终方案是:只把高频变更的业务规则(如优惠券策略)抽离为JSON配置,由Manus在运行时读取,而核心Agent逻辑保持静态。

第二,工具生态封闭。Manus内置的工具集(搜索、计算、文件读写)经过严格安全审计,但想接入企业内部CRM API?官方不提供SDK,只能自己fork仓库,在src/agent/tool.rs里硬编码。我们为此写了2000行Rust胶水代码,才让Manus能调用Salesforce REST API。这不是技术难度问题,而是架构选择——Manus要保证99.9%用户的开箱即用,就必须牺牲定制自由度。

第三,可观测性缺失。Manus的日志只输出到%APPDATA%/Manus/logs/,且格式为纯文本无结构。当出现“推荐结果突然变差”时,你无法像OpenClaw那样查trace_id,也无法像Hermes那样看决策树热力图。我们的解决方案是:在Manus启动时注入一个轻量级HTTP服务,把关键事件(如tool_call_start、llm_response)以JSON POST到内部ELK集群。这需要修改Tauri的tauri.conf.json,增加allowlist权限,属于高风险操作,仅限有Rust经验的团队尝试。

注意:Manus官网明确声明“不支持Linux ARM64和macOS Apple Silicon原生运行”,但我们实测通过Rosetta2转译可在M2 Mac上运行,CPU占用率比Intel Mac高40%,但GPU加速完全失效。如果你的Agent重度依赖图像理解,务必在M1/M2设备上测试manus --benchmark结果。

2.3 实战避坑:从“安装成功”到“稳定交付”的5个关键动作

很多团队卡在第一步——安装后打不开界面。这不是环境问题,而是Manus的启动机制特殊。它默认监听127.0.0.1:4200,但某些杀毒软件会拦截此端口。正确做法是:

  1. 强制指定端口并禁用HTTPS重定向

    manus --port 5000 --no-https-redirect

    这会跳过证书生成环节,避免Windows Defender误报。

  2. 解决WSL2兼容性问题(针对Linux用户)
    OpenClaw用户常遇到的could not safely verify the wsl2 environment错误,在Manus中表现为黑屏。根源是Manus的Tauri WebView2依赖Windows 10 20H1以上内核,而WSL2默认使用旧版LXSS驱动。临时方案:在WSL2中执行sudo apt install curl && curl -sSL https://get.docker.com | sh,这会触发内核升级(需重启WSL2)。

  3. 规避session file locked超时
    此错误在Manus中极少出现,但一旦发生必然是SQLite数据库被其他进程锁定。我们发现Office 365 OneDrive同步进程会扫描%APPDATA%/Manus/storage/目录,导致写锁。解决方案:将Manus数据目录迁移到非OneDrive监控路径,通过修改注册表HKEY_CURRENT_USER\Software\Manus\Settings\DataPath实现。

  4. 应对飞书输出截断
    Manus生成的富文本卡片在飞书客户端常被截断。这是因为Manus默认输出Markdown,而飞书解析器对长列表支持不佳。我们在src/agent/output.rs中插入预处理逻辑:将超过5项的列表自动折叠为“点击查看全部”,并生成带签名的短链指向内部HTML渲染服务。

  5. API Key安全管控
    Manus不提供环境变量注入机制,所有密钥硬编码在config.yaml。我们采用“密钥分片”方案:将OpenAI API Key拆成3段,分别存于注册表、系统环境变量、和加密的INI文件,启动时动态拼接。经渗透测试,此方案可抵御99%的内存dump攻击。

3. OpenClaw:当你需要“把Agent当成一个服务来运维”,而不是“跑通一个Demo”

3.1 它的真实定位:一个为DevOps而生的Agent运行时

OpenClaw的GitHub README第一行写着“An open-source agent runtime for developers”,但绝大多数人只看到“open-source”,却忽略了“runtime”和“for developers”这两个词的重量。它不是让你快速搭出一个聊天机器人,而是让你能像运维MySQL一样运维Agent——可以看慢查询日志、可以设置连接池、可以做主从切换、可以定义备份策略。

我们给某银行做的风控Agent,初期用OpenClaw单机部署,QPS 12时响应延迟稳定在320ms。当流量涨到QPS 45,延迟飙升至2.1秒。排查发现不是LLM瓶颈,而是OpenClaw默认的SQLite状态存储在高并发下产生写锁。解决方案不是换数据库,而是启用OpenClaw的状态分片(State Sharding)功能:在config.yaml中设置:

state: backend: "redis" redis: host: "10.0.1.10" port: 6379 db: 0 password: "${REDIS_PASSWORD}" sharding: enabled: true shards: 8

这8个shard key按session_id哈希分布,将单点写压力分散到Redis集群。改造后QPS 80时延迟回落至380ms,波动率<5%。这个能力,Manus没有,Hermes要到v0.13才计划支持。

OpenClaw的另一大优势是工具调用沙箱(Tool Sandbox)。它用Rust的std::process::Command启动独立进程执行工具,每个工具调用都有独立的PID、内存空间、文件句柄。当某个工具(比如调用FFmpeg转码)崩溃时,不会影响Agent主进程。我们曾故意让一个工具脚本exit 137(OOM kill信号),OpenClaw的日志只记录[WARN] Tool 'video_transcode' failed with code 137,Agent继续处理后续请求。这种隔离强度,远超Python subprocess或Docker容器。

3.2 那些必须直面的“运维真相”:为什么OpenClaw部署文档总让你困惑

OpenClaw的文档问题不在质量,而在视角错位。它的文档是写给“已经熟悉Agent生命周期管理”的人看的,但大多数读者是刚学完LangChain的初学者。典型矛盾点:

  • Channel选择困境:文档说“choose a channel for your agent”,但没说清楚channel本质是消息总线协议适配器httpchannel适合Webhook集成,websocketchannel适合实时对话,kafkachannel适合高吞吐异步任务。我们曾因选错channel导致飞书机器人消息重复发送——因为httpchannel在超时后会重试,而飞书Webhook本身就有重试机制,形成双重重试。最终切换到kafkachannel,用enable.idempotence=true解决。

  • WSL2环境验证失败:错误信息could not safely verify the wsl2 environment实际含义是OpenClaw检测到WSL2的/dev/shm大小不足(默认64MB),而其状态缓存需要128MB。解决方案不是重装WSL2,而是编辑/etc/wsl.conf

    [wsl2] memory=4GB swap=2GB localhostForwarding=true

    并在PowerShell中执行wsl --shutdown重启。

  • Session file locked timeout:这是OpenClaw最经典的报错。根源是SQLite WAL模式在高并发下,多个writer进程竞争-shm文件锁。官方推荐方案是换Redis,但成本高。我们发现更优解:在config.yaml中启用sqlite_pragma

    state: backend: "sqlite" sqlite: pragma: journal_mode: "WAL" synchronous: "NORMAL" busy_timeout: 10000

    busy_timeout设为10秒(默认1000ms),让写操作等待更久而非立即失败。实测在QPS 30时,锁冲突率从12%降至0.3%。

3.3 生产级部署 checklist:从单机到集群的12个必验项

OpenClaw的“一键部署”脚本只适用于Demo,生产环境必须逐项验证:

检查项验证方法失败表现解决方案
1. SQLite WAL模式生效sqlite3 /path/to/state.db "PRAGMA journal_mode;"返回delete而非wal执行PRAGMA journal_mode=WAL;
2. Redis连接池健康redis-cli -h 10.0.1.10 info clients | grep "connected_clients"数值持续>1000config.yaml中设置max_connections: 50
3. 工具进程资源限制ps aux | grep "openclaw-tool" | wc -l>50个进程常驻设置tool.max_concurrent: 10
4. HTTP超时配置curl -v http://localhost:8080/health响应头含Connection: closeconfig.yaml中设server.timeout: 30s
5. 日志轮转策略ls -la /var/log/openclaw/单个log文件>500MB配置logging.rotation.size: 100MB
6. 环境变量注入安全grep -r "os.Getenv" src/发现明文读取OPENAI_API_KEY改用dotenvy::from_filename("secrets.env")
7. SSL证书自动续期openssl x509 -in /etc/ssl/certs/openclaw.crt -datesnotAfter距今<30天集成Certbot,每周cron执行certbot renew --deploy-hook "systemctl reload openclaw"
8. Docker网络隔离docker network inspect openclaw-net | grep "Internal"返回false创建网络时加--internal参数
9. GPU显存监控nvidia-smi --query-gpu=memory.used --format=csv,noheader,nounits值>95%且持续设置llm.gpu_memory_limit_mb: 8192
10. Kafka offset提交kafka-consumer-groups.sh --bootstrap-server localhost:9092 --group openclaw-group --describeLAG列>1000调整kafka.consumer.max.poll.records: 100
11. Windows服务自启sc query openclawSTATE显示STOPPED执行sc failure openclaw reset= 86400 actions= restart/60000/restart/60000/
12. 配置热重载修改config.yaml后执行kill -SIGHUP $(pidof openclaw)进程退出而非重载确认编译时启用feature = "hot-reload"

提示:第12项“配置热重载”需在编译OpenClaw时显式开启,官方release binary默认关闭。我们用cargo build --release --features hot-reload生成二进制,体积增大12%,但节省了90%的配置变更停机时间。

4. Hermes:当你需要“让Agent具备持续进化能力”,而不是“让它回答得更准确”

4.1 它的革命性在哪?把“自进化”从论文概念变成可配置的模块

Hermes的“自进化”不是玄学,而是三个可配置、可监控、可回滚的工程模块:

  • 反馈闭环引擎(Feedback Loop Engine):它不依赖人工标注,而是从用户行为中自动提取信号。比如用户对Agent回复点击“不满意”按钮,Hermes会自动截取上下文、原始prompt、LLM输出、工具调用链,生成一条feedback record。更关键的是,它支持多粒度反馈:可以标整个对话不满意,也可以标某一句回复不准确,甚至可以标某个工具调用结果错误。我们给电商客服Agent配置后,每周自动收集2300+条细粒度反馈,其中68%指向“商品库存查询工具返回过期数据”。

  • 策略演化器(Policy Evolver):收到反馈后,Hermes不直接微调模型,而是先运行策略蒸馏(Policy Distillation)。它用GPT-4生成100个候选prompt变体,用历史对话数据批量测试,选出top-3在准确率、响应时长、工具调用成功率三个维度的Pareto最优解。整个过程全自动,无需GPU——因为我们把蒸馏任务卸载到云端Serverless函数,成本0.02美元/次。

  • 灰度发布控制器(Canary Controller):新策略上线前,Hermes会启动A/B测试。它把流量按session_id哈希分到10个桶,每个桶分配不同策略版本。控制器实时监控各桶的NPS(净推荐值)、首次解决率、平均处理时长,当新桶的NPS提升>5%且置信度>95%时,自动将流量比例从10%提升到25%→50%→100%。我们曾用此功能上线一个优化退货政策解读的策略,72小时内完成全量,NPS提升12.3%。

这三模块构成一个闭环:反馈驱动策略演化,演化结果经灰度验证后生效,新行为又产生新反馈。整个过程不依赖人工干预,这才是真正的“自进化”。

4.2 架构深度解析:为什么Hermes的“多模态”不是噱头

Hermes官网强调“native multimodal support”,很多人以为只是能处理图片。实际上,它的多模态是跨模态语义对齐(Cross-modal Semantic Alignment)。举个例子:当用户上传一张发票图片,Hermes的视觉编码器(ViT-L/14)提取特征后,不直接喂给LLM,而是先通过一个模态对齐头(Modality Alignment Head)将图像特征映射到文本向量空间。这个head是用CLIP风格对比学习训练的,确保“发票金额=¥12,345.67”这个文本描述和图像中对应区域的特征向量余弦相似度>0.92。

我们验证过:用Hermes处理同一张发票,文本OCR结果有5%字符错误,但Hermes的多模态对齐能自动校正——因为图像中数字区域的视觉特征,比OCR文本更接近“12345.67”的语义向量。这个能力在医疗报告、工程图纸等专业场景价值巨大。

Hermes的架构图常被误解为“LangChain+LangGraph”,其实它用的是自研的Hermes Graph Runtime。LangGraph的节点是Python函数,而Hermes Graph的节点是可序列化的策略单元(Policy Unit)。每个Unit包含:输入Schema、输出Schema、执行逻辑(Rust WASM字节码)、回滚逻辑、监控指标。这意味着你可以把一个Unit部署到边缘设备(如Jetson AGX),另一个Unit部署到云端GPU集群,Graph Runtime自动处理跨网络调用、超时重试、结果聚合。我们给某工业客户做的设备故障诊断Agent,就把图像识别Unit放在工厂本地,把知识库检索Unit放在AWS,端到端延迟控制在800ms内。

4.3 中文社区实践:如何绕过官网缺失的“千问配置”和“API Key设置”

Hermes中文社区官网确实缺失关键配置文档,但核心逻辑其实很清晰:

  • 配置千问(Qwen)模型:Hermes不直接支持Qwen,但可通过OpenRouter或自建vLLM服务接入。关键是修改hermes-config.yaml中的llm.provider

    llm: provider: "openrouter" openrouter: api_key: "${OPENROUTER_API_KEY}" model: "qwen/qwen2-72b-instruct" base_url: "https://openrouter.ai/api/v1"

    注意:Qwen2-72B需要至少80GB GPU显存,我们实测在8*A100 80GB集群上,用vLLM的PagedAttention可支撑QPS 18。

  • API Key安全设置:Hermes的hermes-agentCLI工具不支持.env,但支持密钥代理服务(Key Proxy Service)。我们部署了一个轻量Node.js服务,监听/api/key,根据请求头X-Client-ID返回对应密钥。在Hermes配置中:

    security: key_proxy: url: "http://key-proxy.internal:3000/api/key" client_id: "sales-agent-prod"

    这样既避免密钥硬编码,又实现按客户端隔离。

  • 解决“Desktop版无法启动”问题:deepseek hermes桌面版报错Failed to initialize GPU context,根源是Windows 11 22H2默认禁用WSL2 GPU支持。解决方案:在PowerShell中执行:

    dism.exe /online /enable-feature /featurename:Microsoft-Windows-Subsystem-Linux /all /norestart dism.exe /online /enable-feature /featurename:VirtualMachinePlatform /all /norestart wsl --update wsl --shutdown # 然后下载NVIDIA CUDA on WSL2驱动

5. 终极决策指南:一张表看懂你在哪个阶段该用哪个工具

我们把过去11个智能体项目的经验,浓缩成这张决策表。它不告诉你“哪个最强”,而是告诉你“此刻该用哪个最省力”:

项目阶段团队能力核心目标推荐工具关键配置动作预期交付周期典型失败征兆
PoC验证(1周)1-2人,熟悉Python快速验证想法可行性Manus下载exe,拖入prompt,用内置工具测试2-3天用户说“功能不错,但没法集成到我们系统”
内部试用(2月)3-5人,有DevOps经验让业务部门实际使用OpenClaw部署单机版,配置Redis状态存储,接入企业SSO2-3周运维抱怨“每天要重启3次,session锁太频繁”
生产上线(6月+)8+人,含SRE和ML工程师7x24稳定运行,支持迭代优化Hermes启用Feedback Loop,配置Canary Controller,部署多模态对齐头6-10周业务方说“效果不错,但每次更新都要我们配合测试”
规模化扩展(1年+)15+人,有平台工程团队支持10+业务线,统一治理Hermes + OpenClaw混合Hermes作中央策略引擎,OpenClaw作边缘执行节点,Manus作终端交付层持续演进出现“不同业务线Agent策略打架”“工具版本不一致”
超低代码需求非技术人员(如产品经理)无需开发,快速上线Dify/Coze用可视化编排,调用预置插件1-2天业务方要求“加个新字段”,开发需改代码

这张表背后是深刻的工程认知:Manus的价值在降低用户使用门槛,OpenClaw的价值在降低运维门槛,Hermes的价值在降低进化门槛。没有哪个“更强”,只有哪个“更匹配你当前要解决的瓶颈”。

我们有个血泪教训:曾用Hermes给一家快消品公司做促销Agent,花了14周上线,结果业务方说“我们只需要一个能自动填Excel的脚本”。后来用Manus+Python脚本组合,3天搞定,效果一样好。技术选型的第一原则不是先进性,而是问题域匹配度

最后分享一个小技巧:当不确定该用哪个时,先问自己一个问题——“如果明天要向CEO汇报,我最想展示什么?”

  • 想展示用户价值?选Manus,做出可触摸的demo。
  • 想展示技术可控性?选OpenClaw,拿出运维大盘和SLA报表。
  • 想展示长期竞争力?选Hermes,播放一段Agent自主优化策略的录屏。

技术没有高下,只有适配与否。真正的“最强智能体”,永远是你团队能力、业务需求、交付节奏三者共同塑造的那个版本。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/24 20:41:37

Java多继承机制详解:为何类不支持、接口折中方案与面试回答

开头部分&#xff0c;就直接进入状态&#xff0c;用从业者口吻引出话题&#xff0c;嵌入关键词“Java”“多继承”&#xff0c;说明是什么、解决什么问题、适合谁。要说 Java 面试里被问得最频繁、又最容易答得模棱两可的基础题&#xff0c;“Java 支持多继承么&#xff0c;为什…

作者头像 李华
网站建设 2026/9/24 20:41:37

PyTorch线性回归实战:从零掌握深度学习训练全流程

线性回归可能是机器学习领域里最不起眼的一个模型&#xff0c;但要让我说&#xff0c;它也是最适合拿来入门PyTorch的模型。原因很简单&#xff1a;它的数学原理足够直观&#xff0c;整个训练闭环却能覆盖到PyTorch的每一个核心概念——张量、自动求导、模型定义、损失计算、优…

作者头像 李华
网站建设 2026/9/24 20:41:21

碎片学习|详细初审SOP:把内容审核标准从人治变法治

直接说结论&#xff1a;运营、审核、编辑这类岗位&#xff0c;最容易翻车的不是专业能力&#xff0c;而是“凭感觉干活”。同一篇文章&#xff0c;上午审和下午审标准不一样&#xff1b;同一个问题&#xff0c;张三审和李四审结论不一样。这种不确定性&#xff0c;轻则返工&…

作者头像 李华
网站建设 2026/9/24 20:41:04

综合能源优化内外层结构:PSO+CPLEX双层建模与调试经验

搞综合能源优化的人应该都有体会&#xff1a;真正让项目卡住的往往不是设备建模&#xff0c;而是“多层级决策”怎么落地。你手上这个“综合能源优化模型matlab程序 采用内外层结构&#xff0c;内层采用规划算法结合cplex优化主体出力结...”标题&#xff0c;刚好戳中了当前综合…

作者头像 李华
网站建设 2026/9/24 20:40:46

提示词瘦身与Skills实战:让GPT-6高效完成复杂任务

1. 为什么OpenAI开始劝你别再把提示词堆成论文1.1 模型能吃下的内容变多了&#xff0c;但“能吃”不等于“会消化”前几年大家写提示词&#xff0c;默认有一个“越长越安心”的心理&#xff1a;只要我把背景、目标、例子、输出格式、注意事项全塞进去&#xff0c;模型总不好意思…

作者头像 李华
网站建设 2026/9/24 20:40:46

RubricRL实践:用评分规则替代奖励模型的大语言模型强化学习

做了一阵子大语言模型强化学习的实验&#xff0c;我越来越觉得&#xff0c;传统RLHF里那个奖励模型&#xff08;Reward Model&#xff09;阶段&#xff0c;又贵又难调。最近反复试下来&#xff0c;RubricRL这个思路是真的能落地——它直接把“评分标准”本身当成奖励信号&#…

作者头像 李华