NVIDIA 与 Google 联手降低 AI 推理成本:Vera Rubin、A5X 与超大规模 AI 基础设施
AI 模型越来越强,但真正决定 AI 能否大规模落地的,正在变成另一个问题:运行这些模型到底需要多少成本?
2026 年 4 月,在 Google Cloud Next 大会上,Google 与 NVIDIA 公布了面向大规模 AI 推理的新一代基础设施方案。
其中最受关注的是基于NVIDIA Vera Rubin NVL72的A5X 裸金属实例。
根据双方公布的信息,通过硬件与软件协同设计,这套架构的目标是:
- 每个 Token 的推理成本最高降低 10 倍
- 每兆瓦的 Token 吞吐量提高 10 倍
- 单站点集群可扩展到80,000 个 NVIDIA Rubin GPU
- 多站点部署规模最高可达到960,000 个 GPU
这意味着 AI 基础设施的竞争已经不只是"谁的 GPU 更快",而开始进入一个更加复杂的阶段:
如何把计算、网络、软件、能源和数据中心组织成一个高效率的 AI 计算系统。
一、AI 进入"大规模推理"时代
训练一个 AI 模型和运行一个 AI 模型,是两个完全不同的问题。
训练阶段关注的是 数据 → 模型训练 → GPU 集群 → 得到模型。而模型真正进入生产环境以后,系统面对的是大量持续到来的请求:
当模型只服务少量用户时,单次推理的成本可能不是主要问题。但当 AI 应用进入大规模生产环境以后,AI 基础设施开始关注一个非常现实的指标:
每生成一个 Token,需要付出多少计算和基础设施成本?
这也是 NVIDIA 和 Google 此次方案关注的核心。
二、A5X 到底是什么?
此次公布的 A5X 是一种bare-metal instance(裸金属实例),运行在 NVIDIAVera Rubin NVL72rack-scale 系统之上:
这里有一个非常重要的概念:
A5X 不是简单地提供一块 GPU,而是提供一个面向大规模 AI 计算的完整基础设施单元。
新闻强调的也是hardware and software codesign,也就是硬件与软件协同设计。
三、为什么需要"硬件 + 软件"一起设计?
如果只是不断提高 GPU 的峰值计算能力,并不能保证整个 AI 系统的性能同步提高。一个大规模 AI 系统实际上包含多个层次:
任何一层出现瓶颈,都可能影响最终结果。例如 GPU 计算能力很强,但网络通信跟不上,GPU 就得等待数据,整体效率下降。
所以当 GPU 数量从几百、几千扩大到几十万时:
网络和系统调度本身就成为核心技术问题。
四、为什么 A5X 需要 ConnectX-9 和 Google Virgo?
新闻特别提到了一个关键组合:NVIDIA ConnectX-9 SuperNIC + Google Virgo networking technology。
原因很直接——当大量 GPU 同时工作时,它们之间需要交换海量数据: