news 2026/9/5 9:58:59

7 分钟、16 分钟、41 分钟:腾讯阿里字节的办公 Agent,藏着三种时间观

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
7 分钟、16 分钟、41 分钟:腾讯阿里字节的办公 Agent,藏着三种时间观

2026 年 8 月 27 日,阿里发布了全新 Qoder。有意思的不是发布会本身,而是它的定位:「以编码能力为核心、面向所有人的智能体工作空间」

一个写代码的 IDE,把口号改成了"面向所有人"。

如果你把三家今年的动作排成一排,会发现一件挺反常识的事:2026 年国内 AI 打得最凶的战场,不是大模型,不是 Chatbot,是每个人的办公桌面。但冲在最前面的三支部队,番号全都姓"代码"。

腾讯的WorkBuddy,底座是 CodeBuddy——一个 2024 年就存在、差点被砍掉的 AI 编程工具。

阿里的千问办公,前身 QoderWork,出自 Qoder;而 Qoder 的前身是通义灵码,一个 IDE 插件。

字节的TRAE Work,是 TRAE SOLO 的直接升级;而 Trae 从 2025 年 1 月发布那天起,就是一个 AI 原生 IDE。

三家最像"未来办公室"的产品,没有一个是办公软件长出来的。

这就奇了。做文档的有 WPS,做协同的有飞书和钉钉,做表格的更是一大把。按常理,办公 Agent 该从这些地方长出来才对。

结果是,写代码的赢了。

一、母舰:为什么写代码的最先跑通

写代码这件事,可能是训练 Agent 最理想的靶场。理由有四个,一个比一个硬。

第一,代码世界有最诚实的结果反馈。你写的这段逻辑对不对,编译器说了算,测试说了算。跑得通就是跑得通,跑不通就是跑不通,不存在"大概齐"。而办公任务最大的麻烦恰恰在这里——一份周报写得好不好,没有编译器给你判分。一个能在"有明确对错"的环境里练出来的系统,迁移到模糊环境时,至少知道什么叫"检查"。

第二,任务拆解是写代码的基本功。任何一个像样的编程任务,天然要被拆成读代码、改几处、跑测试、看报错、再改。这个"规划—执行—验证—修正"的循环,是 Coding Agent 每天跑几百遍的肌肉记忆。而写一份行业分析报告,本质上也是同一件事:找资料、搭框架、填内容、核对事实、改排版。

第三,工具调用最早在编程场景跑通闭环。MCP、命令行、文件系统、沙箱——这些让 Agent 真正"能动手"的基建,全是在开发者工具里先成熟的。没有这层,Agent 只能陪你聊天。

第四,长程执行的工程难题最先在这里被逼出来。上下文管理、跨会话记忆、权限控制、出错回滚。一个跑三小时的任务怎么不跑偏,这是写代码的人最先撞上的墙,也是他们最先修好的路。

腾讯今年 7 月做了一件挺狠的事,顺手把这件事给证实了。

他们搞了一套 Agent 基准叫 WorkBuddy Bench:260 道题,全部来自腾讯内部真实的代码提交、合并请求和业务场景,然后改写成口语化的角色扮演请求,让模型没法靠搜索引擎反查答案。分成代码、网页、办公、安全四个域,7 个模型用两套 Harness 各跑一遍。

Harness 是模型外面那层执行层,负责上下文、工具调用和任务编排。腾讯拿自家 CodeBuddy Code 跟 Anthropic 的 Claude Code 正面对打。

结果有点尴尬:28 组同模型对比,Claude Code 赢了 17 组,CodeBuddy 只赢 11 组。代码域更干脆,7:0,七个模型换成 Claude Code 之后全部涨分。

但这份榜单真正的价值不在输赢。它证明了另一件事:同一个模型,只换一套 Harness,成绩能差出十几分。安全域的平均绝对变动是 8.6 个百分点。

这个结论的分量很重。它意味着 Agent 的强弱,已经不能只看底层模型了——怎么让模型干活,比用哪个模型干活更关键。

而 Coding Agent,恰恰是最早把 Harness 磨利的地方。

所以当我们看到三家把写代码的能力平移到办公场景时,那不叫跨界,那叫降维。他们手里已经有了一套能规划、能执行、能验证、能回滚的工程系统,现在只是把操作对象从代码仓库,换成了文件夹、表格和浏览器。

Coding Agent 是练兵场。办公 Agent 才是主战场。

二、牌面:三家摆上了什么

先摆事实,再谈判断。

腾讯 WorkBuddy

阿里 千问办公

字节 TRAE Work

上线时间

2026.3.9

2026.8.3

2026.6.9

出身

CodeBuddy(2024)

通义灵码 → Qoder → QoderWork

Trae(2025.1)→ TRAE SOLO

产品形态

桌面 + 独立 App

桌面 + 网页 + 钉钉内置

桌面 + 网页 + 移动端

模型策略

混元、DeepSeek、GLM、Kimi、MiniMax 五家可切

Qwen3.8 自研为主 + 基础/高级/前沿三档 + 开放第三方

豆包 2.1 系列,偏内部闭环

生态锚点

企微、微信、腾讯文档、QQ 邮箱、腾讯会议

钉钉 2600 万企业组织,打通 25 项企业能力

飞书文档、多维表格、豆包 2 亿日活

个人版定价

99 / 199 / 999 元每月

免费 / 98 / 198 元每月

Lite 45 元起,豆包专业版 68 元

6 月桌面端月访问量

2097 万

QoderWork 788 万

TRAE IDE(国内版)1279 万

数据来自易观对 2026 年 6 月国内 17 款桌面端 AI 原生办公智能体的统计,当月合计月访问量超过 6000 万次。腾讯系把 WorkBuddy、CodeBuddy、QClaw、Marvis 加在一起是 3262 万。

这个数字要打个折看:访问量不等于付费用户,更不等于健康的生意。腾讯自己也没披露 WorkBuddy 的绝对付费人数、续费率和单次任务成本。访问量领先只说明产品被用起来了,不说明它已经跑通了。

但另一组数字更能说明问题。IDC《2025 年中国 AI 编程市场份额》按营收口径统计,Qoder 排第一,份额约 47.6%;CodeBuddy 约 6.9%,排第四。易观口径下 WorkBuddy 在办公桌面端一骑绝尘,IDC 口径下 CodeBuddy 在编程市场连前三都进不去。

同一家公司,同一个技术底座,在两个战场上的位置完全颠倒。这件事本身就是这篇文章最好的注脚。

还有三个组织动作,比产品本身更值得记一笔:

7 月,腾讯把 QClaw 并入 WorkBuddy 部门,腾讯文档团队也调整进 CSIG,直接把文档编辑、人机双写、资料库这几块补齐。

7 月 30 日,字节把飞书产品团队并入豆包,由赵祺统管。

8 月 3 日,阿里把 QoderWork、MuleRun、悟空三款产品整合成千问办公,隶属 ATH 部门,交给钉钉 CEO 陈宇森负责。

半年之内,三家不约而同从"赛马"转向"收兵"。这不是巧合,是大家都看明白了:这条赛道已经过了试错期,到了集中兵力的阶段。

三、三条路线,三种时间观

产品哲学这种东西,讲概念没意思,看数字最直观。

有评测拿同一个任务——生成一份行业周报——分别交给三家跑。WorkBuddy 用了 7 分钟,TRAE Work 用了 16 分钟,千问办公用了 41 分钟。

41 分钟对 7 分钟,差了近六倍。这背后是三家公司对"什么叫把活干好"的三种回答。

腾讯 WorkBuddy:先完成,再优化

7 分钟交出来的东西,最接近一份"可以直接改的工作初稿"——结构完整、格式规整,你打开就能在上面动笔。

这套打法是腾讯被逼出来的。WorkBuddy 上线三个月迭代了 40 多个版本,代码基本由 AI 生成,人只负责判断、调试和把关。汤道生说,以前做产品是先写文档、评审、排期、再开发;WorkBuddy 团队是先让 AI 把东西做出来,大家围着能跑的原型提意见。

用 AI 造 AI,这件事本身就把迭代速度拉到了别人跟不上的档位。速度一旦成为肌肉记忆,产品哲学就会本能地偏向"先给你东西"。

它的护城河是穿透力。微信、企业微信、QQ 这套 C 端触达加上 B 端执行的组合,是全网独一份,获客成本极低。腾讯还在推企业微信、腾讯文档、ima、腾讯会议跟 WorkBuddy 打通,加上手机远程遥控电脑、内置 140 多个行业顾问和 2.2 万个技能插件——对非技术岗、对混用多套办公软件的人来说,门槛低到几乎没有。

它的软肋在天花板。混元相对另外两家不算强,WorkBuddy 能切五个模型,某种程度上是因为自家模型撑不住所有场景。开放反而是优势,但代价是复杂推理任务的上限受制于人。更要命的是企业级:复杂审批流、私有化部署、大型政企的定制化流程理解,腾讯明显弱于阿里。行业顾问多是多,但偏通用,法务财务这类垂直领域的专业交付力,还谈不上。

字节 TRAE Work:搜得全,汇得快

16 分钟这条路,流程更像一个熟练的助理:搜关键词、抓信息、汇总整理、生成报告。信息量大,信源偏内容聚合平台,强调覆盖而非深度判断。

它真正的杀手锏是沉淀。TRAE Work 能把 AI 的产出直接落进飞书文档和多维表格,变成团队可以继续协作的工作对象,而不是一份需要复制粘贴的死文件。生成的 HTML 可交互产物能形成可点、可筛的可视化看板,团队打开就能用。加上中文语境的理解准确率和豆包 2 亿日活的底座,字节在"信息获取 + 内容生产"这条链上的体验,确实丝滑。

它的问题在 B 端的纵深。飞书的企业基数远小于企业微信和钉钉,很难触达传统行业和下沉市场。字节也缺大型集团的数字化落地经验,私有化部署和复杂定制服务能力都不如阿里。更让人担心的是模型策略——倾向内部闭环,对外部模型和 API 的开放程度时有争议,这在企业客户那里会直接换算成成本和风险。

C 端到 B 端的转化,字节还在验证。

阿里 千问办公:宁可慢,不能错

41 分钟最慢,但慢得有道理。它在任务执行里加了更多判断步骤,对信息的核验和筛选更审慎,看重判断链条而不是信息罗列。7 分钟生成 12 页财报 PPT 是一回事,41 分钟交出一份经得起老板追问的报告是另一回事。

它押的是组织。深度嵌入钉钉的组织架构,能直接调用审批、日程、待办等 25 项企业能力,实现从"生成"到"执行"的全链路自动化——AI 不只是写份材料,而是能把流程走完。加上 Qwen3.8 自研可控、覆盖十余类岗位的专家套件、组织级 Skill 共享(有律所把自己的方法论打包成团队资产的实际案例),这条路是三家里唯一明确冲着"组织提效"去的。

阿里的教训也在这里。据说钉钉 ONE 曾经 7 日留存不足 10%,证明了在 IM 里硬塞一个"AI 员工"是行不通的。千问办公这次独立出来公测,就是换了个思路:独立品牌建认知,钉钉入口承关系。

它的短板是起步太晚。C 端渗透率低,产品逻辑整体偏 B 端管理,个人用户上手门槛明显更高,轻量化体验不如另外两家。跨生态兼容性也弱,非钉钉企业的迁移成本不低。前期的多线作战让品牌认知一度模糊——QoderWork、悟空、MuleRun 三个名字,整合后能不能真正捏合,还需要时间验证。

一句话总结

快的赌"够用",慢的赌"可信"。

这不是能力差距,是时间偏好。你下午三点要开会,两点五十才想起来要材料——7 分钟那个救命。你要给董事会交一份行业判断,41 分钟那个才敢署名。

四、真正的分水岭在哪

热闹看完了,说三个我认为会决定终局的东西。

第一,胜负手从模型转向 Harness。

WorkBuddy Bench 那个结论值得再强调一遍:同一个模型换套框架,成绩差十几分。这意味着基础模型的能力会越来越普惠,靠模型拉开差距的窗口正在关闭。真正能形成差异化的,是怎么把模型能力和行业知识、专业方法论、企业流程结合起来。

三家里,阿里在这一层的积累最扎实——Gartner 2026 年企业级 AI Coding Agents 魔力象限,Qoder 是唯一进入挑战者象限的中国公司。腾讯则在补,WorkBuddy Bench 本身就是在给自己造尺子。

第二,付费逻辑从卖功能转向卖结果。

AI 办公的好处是用户真的愿意掏钱,这在 To B 里是稀缺的。但定价锚点还没定下来。

现在是按席位收:腾讯 99/199/999 三档订阅,字节 68 元起按调用深度分层,阿里订阅加私有化两条线,企业版普遍锚在 198 元每席每月。

但艾媒的数据很说明问题:59.1% 的企业愿意付费,其中 51.5% 的预算只有每月 300 到 599 元。也就是说,大部分企业愿意为 AI 办公付的钱,撑死两个席位。

按人头算账,从一开始就不符合这个场景的经济学。Agent 替代的是任务,不是人。未来的定价大概率会锚在任务交付的质量上——一份能直接用的报告值多少钱,而不是一个坐在这里的人值多少钱。

谁先把这个账算清楚,谁先跑出正向循环。

第三,从个人工具长到组织能力。

个人办公 Agent 的能力正在快速趋同。PPT、表格、周报,三家都能做,做得还都不差。真正拉开差距的会是三件苦活:真实业务数据的打通、权限与审计体系、行业 Know-how 的封装。

这三件全是 B 端的脏活累活,也全是需要时间和客户陪跑才能攒出来的东西。腾讯有 C 端流量,字节有体验口碑,阿里有企业服务的方法论和组织关系——三条路上的护城河挖到深处,形状完全不同。

政企和央国企市场是客单价最高、迁移成本也最高的赛道。信创适配、合规、服务能力,这些门槛字节目前够不着,腾讯够得着一部分,阿里最熟。

五、所以到底该选哪个

没有完美选手,只有场景适配。

尾声

过去十年,办公软件竞争的核心变量是"协作"。现在这个坐标系正在塌缩。

传统办公软件的原子单位是文件——你创建一个文档,编辑它,发出去。AI 办公的原子单位正在变成任务——你说一句需求,Agent 拆开、执行、交付,文件只是它沿途留下的痕迹。

这次单位换算,才是三家真正在争的东西。

腾讯占了先发和入口,字节占了体验和流量,阿里占了组织和纵深。三条路都还不算稳,也都还没到摊牌的时候。

但有一件事已经很清楚了:这场仗的胜负,不会在发布会现场决定,也不会在模型跑分榜上决定。

它会在某个普通工作日的下午决定——当你对着电脑说"帮我整理一下这季度的材料"的时候,你下意识点开的,是哪一个图标。

BAT 的新三国,战场不在云端。在你桌面上。

资料展示
下面是我整理的AI大模型 学习资料和工具包 预览,适合收藏后按主题逐步学习

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/5 9:52:17

DeepSeek-Harness 调用第三方兼容 API:从配置到多路由排错实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/5 9:52:13

E103-W02 WiFi串口透传模块实战:从AT指令到驱动代码详解

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/5 9:49:22

脱敏卫士合同 AI 审查前置流程:本地脱敏、人工复核与安全副本

脱敏卫士合同 AI 审查前置流程:本地脱敏、人工复核与安全副本把合同交给 AI 审查,真正需要发送的是条款、权利义务、履行条件和风险分配。客户姓名、交易对手全称、联系方式、证件号码、开户地址等真实身份信息,通常不是模型判断违约责任或付…

作者头像 李华
网站建设 2026/9/5 9:44:41

接口调了4次都失败?Spring Boot任务状态与幂等性排查实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/5 9:42:56

揭秘百慕大野兽:AI驱动的高性能代码生成与优化实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/5 9:42:50

CYW240128 提供的驱动例程是否包含 ESP32 与 FPGA 完整调试代码?

CYW240128 图形点阵液晶模块开发实录:规格、驱动与 ESP32/FPGA 调试资源辨析 工业人机界面里,240128 图形点阵屏曾是非常经典的一档:比 12864 更宽,适合画趋势图、汉字和简单菜单,又比彩色 TFT 更耐温、更省电。图中这…

作者头像 李华