摘要:a16z 最新研究显示,Computer Use 类 Agent 时薪 6-8 美元,已低于印度离岸外包的 10 美元,桌面任务基准完成率也首次超过人类。但 85% 意味着每 100 个任务仍失败 15 个,基准分数不等于生产可行性。本文拆解这组数字的成立条件,分析谁先受影响、谁不用慌。
一小时的 AI Agent 现在多少钱?6 到 8 美元。
这是 a16z 合伙人 Fabrizio Serafini 在 8 月 10 日发布的研究《Can Agents Use a Computer Yet?》里给出的数字(来源:a16z 原文)。这项研究测的东西,通俗讲就是"AI 像人一样操作电脑干活"——看屏幕、点鼠标、敲键盘、填表单、跑完一个完整业务流程。它一年前还只是能演示,今年已经有人拿它批量跑生产流程了。
同一条赛道上,印度离岸 BPO 人力是 10 美元一小时,美国本土后台岗位是 30 到 45 美元。
数字一出,不少团队开始坐不住——"要不要把某个标准化外包岗位换成 Agent"成了例会上的常驻话题。
但先别急着下结论。这组数字的背后,有几个前提条件被大多数人忽略了。
三根成本柱子,怎么算出来的
先把账算清楚。Serafini 摆了三根柱子:一小时 Computer Use Agent、一小时印度 BPO 人力、一小时美国本土后台人力。
- Agent:6 到 8 美元,区间 3 到 15 美元。来自一位创业者的估算,再用主流模型 token 定价和公开推理成本交叉校验
- 印度 BPO:约 10 美元,区间 8 到 15 美元,参考 2026 年外包报价追踪平台数据
- 美国本土:30 到 45 美元,起点是美国劳工统计局客服岗位时薪中位数 20.59 美元,再叠加约三成福利和管理成本
Serafini 特意提醒:这组数字该当量级参考,不是精确报价。
而且有个关键细节容易被漏掉——6 到 8 美元是"最贵的跑法"。逐帧截图、全程调用旗舰模型,才会到这个价。真正搭得好的团队,把重复劳动交给写死的代码,只让模型处理需要判断力的环节,混合下来成本降得更快。
85% 的完成率意味着什么
成本只是半边天,另一半是准确率。
Serafini 援引 llm-stats.com 排行榜数据(截至 2026 年 6 月):在 OSWorld-Verified 基准上,最优模型 Claude Fable 5 的完成率达到 85%,而人类测试者在同一任务集上是 72%。一年前,最优模型还只有 42%。
这个基准模拟真实桌面环境,覆盖 Ubuntu、Windows、macOS 工作流——浏览器操作、表单填写、按钮点击,都是后台岗位的日常。
85% 超过 72%,是不是意味着 Agent 已经比人强了?
不是。85% 意味着每 100 个任务有 15 个失败,而后台业务流程要求每一步都成功。Serafini 在原文里专门强调:基准分数不是生产可行性的充分条件,真正决定部署成败的是模型之外的一切——验证机制、异常上报、错误处理,以及当零售商门户一夜之间改版时,系统能不能自己修正。
一位在该领域创业的创始人说得很直接:"直到 2026 年 2 月 Opus 4.6 发布之前,这些模型都不够好,无法独立用于生产环境。"能力跃升是最近半年的事,不是一直如此。
谁在用,怎么用
数字再漂亮,也要看落地。Serafini 举了两个案例:
一个消费品数据平台,部署 Agent 后每月处理 1500 万到 2000 万次门户交互任务。零售商网站更新界面导致传统爬虫失效时,系统 2 小时内完成故障诊断、流程修复和数据恢复,维护团队规模缩减 50%。
一个全球系统集成商,27 条 Agent 工作流每天处理 1800 张 IT 工单,目标是把 25% 的人力从低利润托管服务中释放出来。
注意这两个案例的共同点:都是高重复、可验证、有明确成功标准的流程。门户交互有没有成功、工单有没有处理完,结果是确定的,Agent 干完可以验证。
还有一点被很多人忽略:生产环境里,企业几乎不用 Claude、ChatGPT 这类消费级产品,而是直接调用原始 API,自己搭建沙箱虚拟机、编排逻辑、验证与重试机制。Agent 的产出质量,很大程度取决于围在模型外面的那套 harness 搭得好不好——这跟我们写代码是一个道理,框架好,业务才好。
成本结构:贵在重试
对想部署的团队来说,成本账还有个隐藏项:重试。
Agent 跑一次任务,失败也会消耗 token。如果成功率是 85%,那 15% 的失败任务都要重跑,成本要按"推理成本 + 重试成本"一起算。上下文越长、截图频率越高,利润空间越薄。
所以市场上有三种定价模式在竞争:按任务、按小时、按结果。三种模式对应不同的风险分配——按结果计费对供应商最狠,但也最能倒逼他们优化 harness。目前还没有统一标准。
国内对照:告别价格战
这组数字漂洋过海,到国内语境里要打个折扣看。
国内模型 API 价格正在上行。8 月 17 日起,DeepSeek 对 V4 全系列实行峰谷定价:高峰时段(9:00-12:00、14:00-18:00)V4-Pro 输出 27 元/百万 token,空闲时段半价 13.5 元;V4-Flash 高峰输出 9 元/百万 token(来源:DeepSeek 官方公告,2026 年 8 月)。摩根士丹利 8 月 9 日研报《告别价格战,打响智力战》统计,2026 年第二季度国内大模型 API 平均输入价格 4.9 元/百万 token、输出 21.9 元,相比 2025 年一季度分别上涨约 48% 和 80%(来源:大摩研报,2026 年 8 月)。
两个数据放一起看,结论很清楚:国内模型在 Agent 场景的单任务成本,虽然仍低于海外旗舰(DeepSeek V4-Flash 输出价格是 Claude 系旗舰的零头),但价格差在收窄,而且不再"白菜价"。拿 6 美元的海外数字直接套国内,会高估成本优势——国内企业部署 Agent 的账,得用国内定价重算。
我的判断:谁先慌,谁别慌
外包岗位,第一批受影响。但不是所有外包。受影响的是高重复、可验证、有明确成功标准的流程——数据录入、表单处理、信息核对这类。这类工作 Agent 完成率已经接近甚至超过人工,成本还便宜。
但"替换"没那么快。15% 的失败率意味着必须有人兜底、有人处理异常。企业不会一夜之间裁掉整个外包团队,更可能的路径是:Agent 处理 80% 的标准任务,人力收缩到处理剩余 20% 的异常和边缘情况。岗位数量下降,但不是清零。
企业决策者,别只看 85%。先问三个问题:我的任务每一步都可验证吗?失败了我能及时发现并重试吗?业务流程改了,Agent 能自适应吗?三个都答"是",才值得上;答不上来,先补 harness 再谈部署。
工程师,反而是受益方。护城河从"谁的模型强"转移到"谁懂工作流、谁有验证机制、谁能把 Agent 和业务系统深度集成"。这恰恰是 8 月最值钱的能力——围绕模型搭 harness,把不确定的模型能力变成确定的生产流程。模型会越来越便宜,但搭 harness 的手艺不会贬值。
一句话收尾:拐点是真的,但它是工程拐点,不是裁员信号。慌的人,是只看到 6 美元数字的人;不慌的人,看到了 15% 失败率和 harness 的价值。
作者:唐悦玮 | 从后端出发,用 AI 拓展到全栈的工程师。