2026 年 8 月 27 日,阿里发布了全新 Qoder。有意思的不是发布会本身,而是它的定位:「以编码能力为核心、面向所有人的智能体工作空间」。
一个写代码的 IDE,把口号改成了"面向所有人"。
如果你把三家今年的动作排成一排,会发现一件挺反常识的事:2026 年国内 AI 打得最凶的战场,不是大模型,不是 Chatbot,是每个人的办公桌面。但冲在最前面的三支部队,番号全都姓"代码"。
腾讯的WorkBuddy,底座是 CodeBuddy——一个 2024 年就存在、差点被砍掉的 AI 编程工具。
阿里的千问办公,前身 QoderWork,出自 Qoder;而 Qoder 的前身是通义灵码,一个 IDE 插件。
字节的TRAE Work,是 TRAE SOLO 的直接升级;而 Trae 从 2025 年 1 月发布那天起,就是一个 AI 原生 IDE。
三家最像"未来办公室"的产品,没有一个是办公软件长出来的。
这就奇了。做文档的有 WPS,做协同的有飞书和钉钉,做表格的更是一大把。按常理,办公 Agent 该从这些地方长出来才对。
结果是,写代码的赢了。
一、母舰:为什么写代码的最先跑通
写代码这件事,可能是训练 Agent 最理想的靶场。理由有四个,一个比一个硬。
第一,代码世界有最诚实的结果反馈。你写的这段逻辑对不对,编译器说了算,测试说了算。跑得通就是跑得通,跑不通就是跑不通,不存在"大概齐"。而办公任务最大的麻烦恰恰在这里——一份周报写得好不好,没有编译器给你判分。一个能在"有明确对错"的环境里练出来的系统,迁移到模糊环境时,至少知道什么叫"检查"。
第二,任务拆解是写代码的基本功。任何一个像样的编程任务,天然要被拆成读代码、改几处、跑测试、看报错、再改。这个"规划—执行—验证—修正"的循环,是 Coding Agent 每天跑几百遍的肌肉记忆。而写一份行业分析报告,本质上也是同一件事:找资料、搭框架、填内容、核对事实、改排版。
第三,工具调用最早在编程场景跑通闭环。MCP、命令行、文件系统、沙箱——这些让 Agent 真正"能动手"的基建,全是在开发者工具里先成熟的。没有这层,Agent 只能陪你聊天。
第四,长程执行的工程难题最先在这里被逼出来。上下文管理、跨会话记忆、权限控制、出错回滚。一个跑三小时的任务怎么不跑偏,这是写代码的人最先撞上的墙,也是他们最先修好的路。
腾讯今年 7 月做了一件挺狠的事,顺手把这件事给证实了。
他们搞了一套 Agent 基准叫 WorkBuddy Bench:260 道题,全部来自腾讯内部真实的代码提交、合并请求和业务场景,然后改写成口语化的角色扮演请求,让模型没法靠搜索引擎反查答案。分成代码、网页、办公、安全四个域,7 个模型用两套 Harness 各跑一遍。
Harness 是模型外面那层执行层,负责上下文、工具调用和任务编排。腾讯拿自家 CodeBuddy Code 跟 Anthropic 的 Claude Code 正面对打。
结果有点尴尬:28 组同模型对比,Claude Code 赢了 17 组,CodeBuddy 只赢 11 组。代码域更干脆,7:0,七个模型换成 Claude Code 之后全部涨分。
但这份榜单真正的价值不在输赢。它证明了另一件事:同一个模型,只换一套 Harness,成绩能差出十几分。安全域的平均绝对变动是 8.6 个百分点。
这个结论的分量很重。它意味着 Agent 的强弱,已经不能只看底层模型了——怎么让模型干活,比用哪个模型干活更关键。
而 Coding Agent,恰恰是最早把 Harness 磨利的地方。
所以当我们看到三家把写代码的能力平移到办公场景时,那不叫跨界,那叫降维。他们手里已经有了一套能规划、能执行、能验证、能回滚的工程系统,现在只是把操作对象从代码仓库,换成了文件夹、表格和浏览器。
Coding Agent 是练兵场。办公 Agent 才是主战场。
二、牌面:三家摆上了什么
先摆事实,再谈判断。
腾讯 WorkBuddy | 阿里 千问办公 | 字节 TRAE Work | |
上线时间 | 2026.3.9 | 2026.8.3 | 2026.6.9 |
出身 | CodeBuddy(2024) | 通义灵码 → Qoder → QoderWork | Trae(2025.1)→ TRAE SOLO |
产品形态 | 桌面 + 独立 App | 桌面 + 网页 + 钉钉内置 | 桌面 + 网页 + 移动端 |
模型策略 | 混元、DeepSeek、GLM、Kimi、MiniMax 五家可切 | Qwen3.8 自研为主 + 基础/高级/前沿三档 + 开放第三方 | 豆包 2.1 系列,偏内部闭环 |
生态锚点 | 企微、微信、腾讯文档、QQ 邮箱、腾讯会议 | 钉钉 2600 万企业组织,打通 25 项企业能力 | 飞书文档、多维表格、豆包 2 亿日活 |
个人版定价 | 99 / 199 / 999 元每月 | 免费 / 98 / 198 元每月 | Lite 45 元起,豆包专业版 68 元 |
6 月桌面端月访问量 | 2097 万 | QoderWork 788 万 | TRAE IDE(国内版)1279 万 |
数据来自易观对 2026 年 6 月国内 17 款桌面端 AI 原生办公智能体的统计,当月合计月访问量超过 6000 万次。腾讯系把 WorkBuddy、CodeBuddy、QClaw、Marvis 加在一起是 3262 万。
这个数字要打个折看:访问量不等于付费用户,更不等于健康的生意。腾讯自己也没披露 WorkBuddy 的绝对付费人数、续费率和单次任务成本。访问量领先只说明产品被用起来了,不说明它已经跑通了。
但另一组数字更能说明问题。IDC《2025 年中国 AI 编程市场份额》按营收口径统计,Qoder 排第一,份额约 47.6%;CodeBuddy 约 6.9%,排第四。易观口径下 WorkBuddy 在办公桌面端一骑绝尘,IDC 口径下 CodeBuddy 在编程市场连前三都进不去。
同一家公司,同一个技术底座,在两个战场上的位置完全颠倒。这件事本身就是这篇文章最好的注脚。
还有三个组织动作,比产品本身更值得记一笔:
7 月,腾讯把 QClaw 并入 WorkBuddy 部门,腾讯文档团队也调整进 CSIG,直接把文档编辑、人机双写、资料库这几块补齐。
7 月 30 日,字节把飞书产品团队并入豆包,由赵祺统管。
8 月 3 日,阿里把 QoderWork、MuleRun、悟空三款产品整合成千问办公,隶属 ATH 部门,交给钉钉 CEO 陈宇森负责。
半年之内,三家不约而同从"赛马"转向"收兵"。这不是巧合,是大家都看明白了:这条赛道已经过了试错期,到了集中兵力的阶段。
三、三条路线,三种时间观
产品哲学这种东西,讲概念没意思,看数字最直观。
有评测拿同一个任务——生成一份行业周报——分别交给三家跑。WorkBuddy 用了 7 分钟,TRAE Work 用了 16 分钟,千问办公用了 41 分钟。
41 分钟对 7 分钟,差了近六倍。这背后是三家公司对"什么叫把活干好"的三种回答。
腾讯 WorkBuddy:先完成,再优化
7 分钟交出来的东西,最接近一份"可以直接改的工作初稿"——结构完整、格式规整,你打开就能在上面动笔。
这套打法是腾讯被逼出来的。WorkBuddy 上线三个月迭代了 40 多个版本,代码基本由 AI 生成,人只负责判断、调试和把关。汤道生说,以前做产品是先写文档、评审、排期、再开发;WorkBuddy 团队是先让 AI 把东西做出来,大家围着能跑的原型提意见。
用 AI 造 AI,这件事本身就把迭代速度拉到了别人跟不上的档位。速度一旦成为肌肉记忆,产品哲学就会本能地偏向"先给你东西"。
它的护城河是穿透力。微信、企业微信、QQ 这套 C 端触达加上 B 端执行的组合,是全网独一份,获客成本极低。腾讯还在推企业微信、腾讯文档、ima、腾讯会议跟 WorkBuddy 打通,加上手机远程遥控电脑、内置 140 多个行业顾问和 2.2 万个技能插件——对非技术岗、对混用多套办公软件的人来说,门槛低到几乎没有。
它的软肋在天花板。混元相对另外两家不算强,WorkBuddy 能切五个模型,某种程度上是因为自家模型撑不住所有场景。开放反而是优势,但代价是复杂推理任务的上限受制于人。更要命的是企业级:复杂审批流、私有化部署、大型政企的定制化流程理解,腾讯明显弱于阿里。行业顾问多是多,但偏通用,法务财务这类垂直领域的专业交付力,还谈不上。
字节 TRAE Work:搜得全,汇得快
16 分钟这条路,流程更像一个熟练的助理:搜关键词、抓信息、汇总整理、生成报告。信息量大,信源偏内容聚合平台,强调覆盖而非深度判断。
它真正的杀手锏是沉淀。TRAE Work 能把 AI 的产出直接落进飞书文档和多维表格,变成团队可以继续协作的工作对象,而不是一份需要复制粘贴的死文件。生成的 HTML 可交互产物能形成可点、可筛的可视化看板,团队打开就能用。加上中文语境的理解准确率和豆包 2 亿日活的底座,字节在"信息获取 + 内容生产"这条链上的体验,确实丝滑。
它的问题在 B 端的纵深。飞书的企业基数远小于企业微信和钉钉,很难触达传统行业和下沉市场。字节也缺大型集团的数字化落地经验,私有化部署和复杂定制服务能力都不如阿里。更让人担心的是模型策略——倾向内部闭环,对外部模型和 API 的开放程度时有争议,这在企业客户那里会直接换算成成本和风险。
C 端到 B 端的转化,字节还在验证。
阿里 千问办公:宁可慢,不能错
41 分钟最慢,但慢得有道理。它在任务执行里加了更多判断步骤,对信息的核验和筛选更审慎,看重判断链条而不是信息罗列。7 分钟生成 12 页财报 PPT 是一回事,41 分钟交出一份经得起老板追问的报告是另一回事。
它押的是组织。深度嵌入钉钉的组织架构,能直接调用审批、日程、待办等 25 项企业能力,实现从"生成"到"执行"的全链路自动化——AI 不只是写份材料,而是能把流程走完。加上 Qwen3.8 自研可控、覆盖十余类岗位的专家套件、组织级 Skill 共享(有律所把自己的方法论打包成团队资产的实际案例),这条路是三家里唯一明确冲着"组织提效"去的。
阿里的教训也在这里。据说钉钉 ONE 曾经 7 日留存不足 10%,证明了在 IM 里硬塞一个"AI 员工"是行不通的。千问办公这次独立出来公测,就是换了个思路:独立品牌建认知,钉钉入口承关系。
它的短板是起步太晚。C 端渗透率低,产品逻辑整体偏 B 端管理,个人用户上手门槛明显更高,轻量化体验不如另外两家。跨生态兼容性也弱,非钉钉企业的迁移成本不低。前期的多线作战让品牌认知一度模糊——QoderWork、悟空、MuleRun 三个名字,整合后能不能真正捏合,还需要时间验证。
一句话总结
快的赌"够用",慢的赌"可信"。
这不是能力差距,是时间偏好。你下午三点要开会,两点五十才想起来要材料——7 分钟那个救命。你要给董事会交一份行业判断,41 分钟那个才敢署名。
四、真正的分水岭在哪
热闹看完了,说三个我认为会决定终局的东西。
第一,胜负手从模型转向 Harness。
WorkBuddy Bench 那个结论值得再强调一遍:同一个模型换套框架,成绩差十几分。这意味着基础模型的能力会越来越普惠,靠模型拉开差距的窗口正在关闭。真正能形成差异化的,是怎么把模型能力和行业知识、专业方法论、企业流程结合起来。
三家里,阿里在这一层的积累最扎实——Gartner 2026 年企业级 AI Coding Agents 魔力象限,Qoder 是唯一进入挑战者象限的中国公司。腾讯则在补,WorkBuddy Bench 本身就是在给自己造尺子。
第二,付费逻辑从卖功能转向卖结果。
AI 办公的好处是用户真的愿意掏钱,这在 To B 里是稀缺的。但定价锚点还没定下来。
现在是按席位收:腾讯 99/199/999 三档订阅,字节 68 元起按调用深度分层,阿里订阅加私有化两条线,企业版普遍锚在 198 元每席每月。
但艾媒的数据很说明问题:59.1% 的企业愿意付费,其中 51.5% 的预算只有每月 300 到 599 元。也就是说,大部分企业愿意为 AI 办公付的钱,撑死两个席位。
按人头算账,从一开始就不符合这个场景的经济学。Agent 替代的是任务,不是人。未来的定价大概率会锚在任务交付的质量上——一份能直接用的报告值多少钱,而不是一个坐在这里的人值多少钱。
谁先把这个账算清楚,谁先跑出正向循环。
第三,从个人工具长到组织能力。
个人办公 Agent 的能力正在快速趋同。PPT、表格、周报,三家都能做,做得还都不差。真正拉开差距的会是三件苦活:真实业务数据的打通、权限与审计体系、行业 Know-how 的封装。
这三件全是 B 端的脏活累活,也全是需要时间和客户陪跑才能攒出来的东西。腾讯有 C 端流量,字节有体验口碑,阿里有企业服务的方法论和组织关系——三条路上的护城河挖到深处,形状完全不同。
政企和央国企市场是客单价最高、迁移成本也最高的赛道。信创适配、合规、服务能力,这些门槛字节目前够不着,腾讯够得着一部分,阿里最熟。
五、所以到底该选哪个
没有完美选手,只有场景适配。
尾声
过去十年,办公软件竞争的核心变量是"协作"。现在这个坐标系正在塌缩。
传统办公软件的原子单位是文件——你创建一个文档,编辑它,发出去。AI 办公的原子单位正在变成任务——你说一句需求,Agent 拆开、执行、交付,文件只是它沿途留下的痕迹。
这次单位换算,才是三家真正在争的东西。
腾讯占了先发和入口,字节占了体验和流量,阿里占了组织和纵深。三条路都还不算稳,也都还没到摊牌的时候。
但有一件事已经很清楚了:这场仗的胜负,不会在发布会现场决定,也不会在模型跑分榜上决定。
它会在某个普通工作日的下午决定——当你对着电脑说"帮我整理一下这季度的材料"的时候,你下意识点开的,是哪一个图标。
BAT 的新三国,战场不在云端。在你桌面上。