# 算力正在变「自来水」:无服务器 GPU 与 Agent 执行层基础设施的 2026 拐点
一、执行摘要
2026 年 8 月 3 日,Cloudflare 在 Agents Week 开源@cloudflare/computer,定位一句话:「Give your agent a computer」。每个 Agent 获得一台秒级启动的隔离云机器——代码执行、浏览器、文件系统,状态存放在 Durable Object 内的 SQLite 虚拟文件系统,计算按需落在轻量 V8 isolate 或完整 Linux 容器上,单日 +891 星登顶 GitHub Trending。三天后,Fly.io 宣布完成 $25M D 轮、全力押注「Computers for Agents」,同一周却宣布 7 月 31 日起弃用 GPU 业务,写下一篇《We Were Wrong About GPUs》[A]。
这两个信号放在一起,构成了 2026 年 Serverless GPU 最值得解读的图景:GPU 本身正在被商品化,价值从「拥有一块卡」迁移到「如何把算力按需、秒级、廉价地交给模型和 Agent」——也就是无服务器(serverless)这一层软件。市场在为此定价:GPU-as-a-Service 市场预计从 2025 年 $8.21B 增至 2030 年 $26.62B(26.5% CAGR)[B];AI 推理市场从 $113.47B 增至 $253.75B(17.5% CAGR)。过去 18 个月,Modal($4.65B)、Baseten($5B)、Together AI($8.3B)、Fireworks AI($17.5B)估值狂奔,但没有任何一家披露实现现金流为正——钱在换增长,不在换利润。
我判断:Serverless GPU 的卖点已经从「便宜」迁移到「省心 + 快」。2026 年的胜负手有两件:一是快照技术把 70B 级模型的冷启动从分钟压到个位数秒;二是「Agent 执行层」的归属——当 Cloudflare 把沙箱做成 CDN 内置能力,独立沙箱厂商的商业模式正在被结构性挤压。
二、为什么是 2026:算力从「资产」到「自来水」的三股力量
2.1 需求端:推理越过了训练,Agent 让负载变得极端
2026 年,推理已占 AI 算力需求超过 60%,首次压过训练。但真正改变 serverless 成本结构的,是 Agent 工作负载的形态:Agentic 任务的中位运行时长约 8 分钟,峰值内存是平均的 15.4 倍,98.5% 的内存尖峰发生在工具调用期间,而操作系统与容器初始化要吃掉端到端延迟的 56%-74% [A]。这意味着 Agent 负载天然「突发、短命、并行」——与 batch 训练的持续高占用完全不同,恰恰是 scale-to-zero 的理想靶子。
同时,算力供给端全面收紧:Blackwell 已售罄至 2026 年中,新集群交付周期 6-7 个月,H100 一年期租赁价格从 $1.70/时涨到 $2.35/时(+40%),HBM 缺口 50-60%。需求 10x 对供给 3.4x 的剪刀差,是 2026 年 GPU 定价全面上浮的根本原因。
2.2 成本结构:scale-to-zero 是一道利用率算术题
serverless GPU 的经济学本质是「利用率套利」:平台把大量客户的尖峰负载混在一起,让总体利用率维持高位,而每个客户只为自己活跃的秒数付费。但它的成立有边界:综合各方数据,专用实例只有在 GPU 利用率超过约 15%-25%(中国市场测算约 52%)时才更划算 [B];而 2026 年生产环境 GPU 的平均利用率只有约 5%。换句话说,对大多数利用率不足的团队,「自建反而更贵」——这正是 serverless 模式的结构性红利。
上图:Serverless GPU 的价值链——上游 GPU 所有者提供算力,中间轻资产的 serverless 层做调度与按秒计费,下游是编码、企业、计算机使用三类 Agent 应用。
2.3 供给端:涨价潮逆转了「推理价格只跌不涨」的惯性
2025 年前 Token 价格两年降幅超 90%,但 2026 年 4 月起涨价潮全面到来:阿里云算力涨价 5%-34%、百度智能云 5%-30%、商汤训练套餐 +12%、UCloud +15%、AWS ML 实例 +15%。此前「推理价格低于算力成本」的倒挂正在被修复——这反而让按量付费的 serverless 模式在采购谈判中更有吸引力,因为它的单价透明、且不绑定长期承诺。
三、冷启动战争:2026 年最大技术变量已经打完
3.1 冷启动的解剖
一次 vLLM scale-to-zero 冷启动(Llama 3.1-8B / A10G,约 33 秒)由五段构成:容器拉取约 8s、运行时初始化约 3s、权重下载约 12s、GPU 传输约 8s、CUDA graph 捕获与 warmup 约 2s。70B 级模型全冷启动要 2-5 分钟,在交互式场景中不可接受。2026 年 6 月 MLSys 论文《Breaking the Ice》首次系统化研究得出一个反直觉结论:瓶颈在 CPU 侧,换更快的 GPU 并不能缩短启动时间[C]。
3.2 破局点:状态快照与恢复
2026 年真正改变战局的是快照技术:
- NVIDIA CUDA Checkpoint API(CUDA 570+):进程级 lock/checkpoint/restore,保留 device 内存、CUDA 内核(含 torch.compile 产物)与 CUDA graph;vLLM 已提案原生集成,Modal 用该 API 演示 10 倍冷启动改善;
- Modal GPU 内存快照:Ministral-3B 冷启动 118s→12s、Qwen2.5-0.5B+vLLM 45s→5s;
- RunPod FlashBoot:CRIU 式进程快照,同机恢复 7-8s(vLLM 引擎子进程 PID 不变、无需重编译)。
上图:冷启动的构成与破局——五段式全冷启动约 33 秒,2026 年 CUDA Checkpoint、GPU 内存快照等快照技术把恢复压到个位数秒,冷启动从「能不能用」变成「要不要付费」。
3.3 推论:冷启动之战已接近终局,经济账随之重算
平台侧 7B 模型冷启动已收敛到:Baseten 10-15s、Modal 8-12s、Replicate 5-10s、RunPod 15-30s(FlashBoot 恢复 7-8s)。当冷启动进入秒级,scale-to-zero 的适用范围从「批处理/离线」扩展到「交互式推理与 Agent 执行」。我原以为冷启动会是 serverless GPU 长期的天花板,但 2026 年的快照技术基本把这个天花板拆掉了——剩下的约束只剩利用率算术。
四、产品版图:三极分化
2026 年的 Serverless GPU 市场已分化为三个清晰的极:
极一 · 生产推理:Modal(Python 原生、@app.function即部署,H100 约 $3.95/时按秒计费)、Baseten(生产级 SLA,H100 $6.50/时)、Replicate(5 万+ 预置模型,已被 Cloudflare 收购)、Together AI 与 Fireworks AI(大模型推理平台)。
极二 · Agent 沙箱 / 执行层:E2B(Firecracker microVM,约 150ms 冷启动,无 GPU,主打强隔离)、Modal(gVisor 容器)、Cloudflare@cloudflare/computer(V8 isolate + 容器双后端)、Fly.io(持久 VM 路线)。
极三 · 弹性低价算力:Vast.ai(P2P 市场,H100 spot 低至约 $0.36/时但随时被回收)、Hyperbolic、Nebius(Yandex 系,B200 $3.95/时)、Fal.ai(生成式媒体,H100 $1.89/时)、Novita(L40S $0.55/时)。
大云厂商的座次值得单独点名:AWS Lambda 至今无 GPU(GPU 路径仍走 EC2/SageMaker),Google Cloud Run 是 2026 年最成熟的 serverless GPU(L4,scale-to-zero 容器 5-7s 冷启动),Azure Container Apps 支持 GPU 挂载但 Functions 尚不支持 [B]。大云的迟到,给了独立厂商两年的窗口期。
上图:2026 年 Serverless GPU 的三极分化——生产推理、Agent 沙箱执行层、弹性低价算力各自成军,三极之间互相渗透(Modal 同时出现在极一与极二)。
五、市场与资本:估值狂奔与「轻资产套利」
5.1 融资全景(2026 上半年)
| 公司 | 最新轮次 | 估值 | 收入信号 |
|---|---|---|---|
| Modal | C 轮 $355M(2026.5) | $4.65B | 年化收入约 $300M [A] |
| Baseten | E 轮 $300M(2026.1,Nvidia 投 $150M) | $5B | ARR $30M(2025.3)→$600M(2026 Q1) |
| Together AI | C 轮 $800M(2026.7,Aramco Ventures) | $8.3B | 年化预定 $1.15B |
| Fireworks AI | D 轮 $1.5B(2026.7) | $17.5B | ARR 超 $1B |
| RunPod | A 轮 $100M(2026.6) | $1B | ARR $120M→约 $240M [B] |
| Replicate | 被 Cloudflare 收购(2025.11) | 头条约 $550M / 实际对价 $57.4M [B] | 2024 年收入约 $5M |
这张表有三个耐人寻味的点。其一,Baseten 一年内 ARR 从 $30M 涨到 $600M(20 倍),是整个赛道最激进的增长曲线 [B]。其二,Replicate 的收购头条价与 SEC 披露的实际现金对价之间差了近 10 倍,说明「serverless GPU 的退出估值」水分不小。其三,没有任何一家披露现金流为正——这个赛道处在典型的「增长优先于利润」阶段。
5.2 商业模式:不拥有 GPU 的调度者
serverless 厂商大多是「轻资产调度者」:Modal 对接 13 家云供应商(一年前还是 5 家),Baseten 从约 20 家供应商采购,RunPod 用收入分成模式整合第三方数据中心。它们的护城河不在物理容量,而在调度算法、冷启动延迟(RunPod FlashBoot、E2B 快照)与开发者体验。与之对比,上游的 CoreWeave 深度亏损(FY25 每股 -$2.81、自由现金流 -$7.3B),Nebius 是唯一接近盈利的(Q1’26 调整后 EBITDA $130M)[A]。重资产承担周期风险,轻资产赚取利用率价差——这是 2026 年 GPU 产业链最清晰的分工。
5.3 NVIDIA:既是裁判又是运动员
NVIDIA 一面通过 NVCF(Cloud Functions)与 DGX Cloud 直接下场卖 serverless 推理,一面又以 $150M 投资 Baseten、参投 Fireworks 与 Together、$2B 投资 Nebius 9.3% 股权 [B]。这种「既竞争又投资」的姿态,本质是在整个推理层建立影响力网络——它是这个市场事实上的 kingmaker。
六、企业落地:谁在生产环境真的用上了
6.1 头部厂商的可验证客户
- Modal:累计启动 10 亿+ 沙箱,沙箱业务贡献超过 1/3 收入;客户包括 DoorDash(商户侧 Agent)、Cognition、Decagon(p90 延迟 342ms)、Ramp(其编码 Agent 撰写 70% 的合并 PR)[A];
- RunPod:月流水已过 $240M 年化,客户含 Zillow、OpenAI、Perplexity、Civitai(每月 80 万 LoRA、500+ 并发 GPU);其《State of AI》报告显示 Qwen 已超越 Llama 成为自托管部署最多的开源模型 [A];
- Baseten × Hebbia:面向投行的机构智能平台,迁移后 token 吞吐 2.5 倍、首 token 时间快 4 倍、推理成本降低 10 倍以上;
- Together × Washington Post:Ask The Post AI 每月处理 17.9 亿输入 token、约 2 秒响应。
这些数字全部是厂商发布的、未经独立审计,但它们的共同信号是:serverless GPU 已经有「名字级」的生产用户,而不是 demo。
6.2 ROI 的真实区间
- 低流量 LoRA 特性(约 200 次/天):常驻约 $400/月 → serverless 约 $5/月 [C];
- Mistral-7B 聊天机器人:$2,400/月 → $780/月(-67%)[C];
- 某创业公司通过 Karpenter + 按量缩容 + spot,把 32 台 A100 从 $75K/月压到 $39K/月(-48%)。
6.3 采购模式的分岔
2026 年企业采购明显分两派:AI-native 团队用信用卡直接采购 Modal/RunPod/Together(按 API 而非按基础设施合同);受管制的企业要求 kernel 级隔离、数据驻留与 BYOC——这正是 E2B(microVM)和 Cloudflare(VPC/Zero-Trust)强调合规姿态而非原始速度的原因。中间派则用 K8s + Karpenter + KEDA 自建 scale-to-zero,把「serverless 经济学」搬回自己集群里。
七、Cloudflare 与「执行层大厂化」:把沙箱做成 CDN
7.1 架构赌注:状态与计算分离
@cloudflare/computer的核心设计是把「状态」和「计算」彻底分离:状态放在 SQLite Durable Object 里持久化,计算是「可丢弃」的一次性执行,两个可互换后端共享同一文件系统——V8 isolate(just-bash把 shell 命令编译成 JS,秒级启动、低内存)用于日常文件/数据处理,完整 Linux 容器(Cloudflare Containers)用于装包和任意二进制。Cloudflare 的目标是让容器只承担 Agent 工作量的不到 10%——这是一个未经实证的假设,也是它最受质疑的点:isolate 是语言级隔离而非硬件级隔离[D]。
上图:@cloudflare/computer 的架构——状态放在 Durable Object 持久化,计算按命令在 V8 isolate 与完整容器之间选择,计算可丢弃、状态可恢复。
7.2 经济模型与对 E2B/Modal 的挤压
Agent 挂在 Durable Object 上,休眠时计算零成本(actor 模式):1 万个 Agent 各活跃 1%,只相当于约 100 个常驻实例。定价上,Cloudflare Sandboxes 约 $0.00002/活跃 vCPU 秒,按 100 万次请求约 $200/月计算,对比 E2B 同类量级 $1,000+ 与容器热池 $2,000+ [C]。配合收购来的 Replicate 模型库(5 万+ 模型),Cloudflare 正在把 Agent 基础设施的成本曲线压向「CDN 的价格」——这是对按「沙箱每秒」收费的独立厂商的商业模式威胁。
7.3 反例:Fly.io 承认「我们错了」
Fly.io 的 GPU 业务在 2026 年 7 月 31 日被弃用。官方坦承「We Were Wrong About GPUs」:大多数开发者要的不是 GPU,而是 LLM API;只有 L40S 找到了一点市场 [A]。这个反例极其重要——它说明「serverless GPU」的用户买的从来不是 GPU 本身,而是「不用管 GPU 的推理」。当 Fly.io 转向「Computers for Agents」(持久磁盘 + 秒级启动 VM)并拿到 $25M D 轮时,它其实在用另一种方式回应同一个需求。
八、中国视角:涨价潮、算力券与「Token 工厂」
8.1 云厂商的按需 GPU 走向工程成熟
阿里云函数计算(FC)2026 年 1 月发布 GPU「浅休眠」:无请求时实例休眠而非销毁,唤醒仅 500ms-2s,某深圳 OCR 业务降本近 70%;支持 1/8、1/4 卡虚拟化,部署成本可降 90% 以上 [A]。火山引擎 2026 年 3 月商用 Serverless 上下文检索,GPU 按量最低 9.16 元/时。华为云则明确不打价格战,走「Agentic Infra」路线,昇腾 910B 推理成本约为 H100 方案 1/3。
8.2 「Token 工厂」的毛利拷问
以硅基流动为代表的独立推理平台 2026 年 6 月 30 日递表港交所(18C 章),估值 77.4 亿元,三年涨 33 倍——但 2025 年营收仅 5,533 万元、净亏 3.45 亿、毛利率转负至 -24%(公有云业务低至 -119%),付费客户 71.6 万家但 ARPU 仅约 22 元 [A]。这是「免费 Token 换规模」模式的代价:营收爆炸、毛利为负。对比海外 Baseten 的 $600M ARR,国内独立平台的商业化差距不在技术,而在付费意愿与开源生态的挤压。
8.3 中国没有「GPU+沙箱一体」的 Modal
国内 Agent 执行层走的是「兼容 E2B SDK + 应用平台内嵌」路线:腾讯云 CubeSandbox(RustVMM microVM,直接兼容 E2B SDK,冷启动 P95 仅 78.3ms)、PPIO(首个兼容 E2B 接口的 Agent 沙箱,已接入 Dify/Camel/OpenManus)、阿里 OpenSandbox(一套 API 对接 Docker/gVisor/Kata/Firecracker 四种引擎)[B]。Dify v1.16.0 也在 2026 年 7 月首次内置完整 Linux 沙箱。独立「中国版 Modal」仍是结构性空白[D]。
8.4 政策杠杆:算力券
贵州 2026 年计划发放 1.4 亿元算力券、补贴最高 30%,算力规模从 170 增至 190 EFLOPS [A]。算力券本质是政府补贴「按需 GPU」的价格,等于在给 serverless 模式的客户侧再添一把火。综合各方测算,GPU 利用率 52% 是「自建 vs 按量」的盈亏平衡线,而多数 AI 创业公司利用率落在 30-50%——自建反而更贵,直接利好按量模式。
九、判断与风险
判断一:冷启动战争 2026 年基本打完。快照技术让 70B 级模型冷启动进入个位数秒,vLLM 正在把 CUDA Checkpoint 与 Pod Snapshot 变成一等公民。我赌 2027 年之前,「冷启动多快」不再是 serverless GPU 的差异化卖点,而是默认能力。
判断二:真正的壁垒在「执行层软件」而非 GPU。当算力变成自来水,能挣钱的不是拥有水的,而是控制水龙头的——调度算法、快照栈、Agent 沙箱的隔离与审计。轻资产调度者(Modal/Baseten)会继续蚕食重资产层的毛利空间,但前提是把利用率套利做对。
判断三:Agent 沙箱与推理会收敛为一个市场。Modal 的沙箱收入已超 1/3、Cloudflare 用 Replicate 补模型层、Fly.io 弃 GPU 而押 Agent VM——2027 年的 serverless 计算将是「给 Agent 的机器 + 给模型的 GPU」的混合体。先不下结论:究竟是沙箱吃掉推理(Cloudflare 路线)还是推理长出沙箱(Modal 路线),取决于 Agent 工作负载里 GPU 密集型任务的比例。
判断四:中国「Token 工厂」将迎来毛利大考。硅基流动的 -24% 毛利率与涨价潮叠加,意味着免费补贴换规模的模式走到尽头。我原以为国内会复制海外的 ARR 神话,但 2026 年的数据显示:独立推理平台的商业化差距不在技术,而在付费意愿。2026 Q4 可能才是国内 API 定价的底部。
判断五:多租户安全是下一个雷。MICRO’26 论文 GhostAccess 展示了首个无需 GPU 访问即可跨租户窃听的 GPU 侧信道——利用 CUDA Unified Memory 未文档化行为,完全绕过 NVIDIA MIG(MIG 只降 4.7% 信道容量),在阿里云/AWS 五套硬件验证 [B]。当 serverless 把更多租户塞进同一块 GPU,隔离就是合规底线,也是成本项。
风险清单:① 供应商风险已实证(Fly.io 弃 GPU、Replicate 被收购);② scale-to-zero 的「幽灵账单」——自动扩缩容误配置导致 GPU 空转计费;③ 冷启动虽然变快但仍在计费,利用率误判会把省下的钱加倍还回去;④ 大云一旦补课(AWS Lambda 上 GPU),独立厂商的窗口期会急剧收窄。
十、关键监测指标(2026 下半年)
- Lambda IPO(传闻 H2 2026,$8-12B)——检验市场对「非 CoreWeave」GPU 故事的胃口
- Fly.io 弃用 GPU 后客户去向(RunPod/Modal/GCP Cloud Run?)与「Computers for Agents」的实际采用
@cloudflare/computer的生产采用与定价透明度(isolate 隔离被攻击验证的事件)- vLLM 是否把 CUDA Checkpoint 集成进正式版,以及快照成为多 GPU 部署的默认能力
- 中国涨价潮(阿里/百度/商汤/UCloud)是否传导到按量 serverless 定价,以及硅基流动上市进程
- NVIDIA 在推理层的投资网络(Baseten/Fireworks/Together/Nebius)是否进一步整合成「NVIDIA 云联盟」
证据等级:[A] 官方/一手 [B] 2+可靠来源 [C] 单一来源 [D] 个人判断
AI 辅助深度研究,人工视角解读。每日更新。
参考来源
- Cloudflare — @cloudflare/computer 与 Replicate 收购(官方博客)
- Modal — Series C 与「真正无服务器的 GPU」(官方博客 + Reuters)
- Baseten — $300M Series E(官方博客)
- Together AI — $800M Series C(官方博客)
- MarketsandMarkets — GPU-as-a-Service 市场预测
- Grand View Research — AI 推理市场规模
- RunPod — 突破 $120M ARR 与 $100M A 轮(官方 + TechCrunch)
- Fly.io — $25M D 轮与「We Were Wrong About GPUs」
- SiliconANGLE — Cloudflare 收购 Replicate($57.4M 实际对价)
- vLLM — CUDA Checkpoint 集成提案 RFC #34303
- 阿里云开发者 — 函数计算 GPU 浅休眠
- 界面新闻 — 硅基流动递表港交所(估值/毛利/客户数据)
- 36氪 — 算力涨价潮与 API 定价认知套利
- AgentCgroup — Agent 工作负载特征研究(arXiv:2602.09345)
- TheNextWeb — Together AI $800M C 轮(Aramco Ventures)
- SegmentFault — 国内 Agent 平台沙箱横评
- 贵州省大数据局 — 2026 年算力券 1.4 亿元
- GitHub — Cloudflare Agents(含 @cloudflare/computer)
- RuntimeWire — Hark Handoff 发布
- FreeBuf — GhostAccess GPU 侧信道(MICRO’26)